← 研究動態
一般讀者2026/08/20 上午11:09

複雜模型越疊越笨?當你手握十幾個量化指標,用四道檢查門避開過度擬合與模型過載

波動率預測統計檢定量化模型模型過載

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

複雜模型越疊越笨?當你手握十幾個量化指標,用四道檢查門避開過度擬合與模型過載

在量化交易與策略開發的世界裡,幾乎每個研究者都踩過同一個陷阱: 當一個簡單模型運作得還不錯時,直覺會驅使你為它加上更多層複雜邏輯。 

看到市場波動忽高忽低,就想加入「兩狀態切換」或「多重碎形」機制;覺得參數固定太死板,就設計「每日動態權重漂移」或「線上 Conformal 混合」;嫌傳統統計模型太老舊,就把最新熱門的「時序基礎 AI 模型」或「貝氏 MCMC 抽樣」搬進估計流程。

這些新機制在論文或宣傳上聽起來都無比精妙,每一層數學都有極其漂亮的理論依據。但在實戰中,把十幾個複雜指標與模型疊在一起,隔天的預測真的會變準嗎?還是你只是付出了龐大的維護算力,卻買回了一堆在樣本外瞬間崩潰的過度擬合(Overfitting)與噪音?

本期精選導讀,我們攤開過去數月在美股(SPY、QQQ、TLT、GLD)、日股(^N225)、台股(0050.TW、TX)跨市場超過兩萬筆逐日預測的八項嚴格實驗。結果展示了一個極其殘酷的量化現實: 絕大多數精心設計的複雜擴充機制,在樣本外(Out-of-Sample, OOS)的嚴格擂台上,全數輸給了一行只有兩三個參數的簡單老公式。 

為了防止你的交易系統被「複雜度幻覺」綁架,本期將為你建立一套可立即套用的運算審核機制—— 「模型優化四道檢查門 (Four Quality Gates for Model Optimization & Selection)」 。


本期唯一要你帶走的東西:模型優化四道檢查門

當你準備在交易系統中引入新變數、動態權重或複雜 AI 模型時,請不要被漂亮的擬合曲線誘惑。把新模型送進這四道檢查門,順序不能顛倒:

順序檢查門名稱你在確認什麼沒通過的意思/答錯的代價
一 基準比較門 (Benchmark Gate) 新機制/複雜模型有沒有統計顯著地打贏最老派簡單的 Baseline(如 3 參數 HAR-RV 或 GJR-GARCH)?複雜度只換來自嗨,沒換來真正增量預測力
二 權重穩定門 (Weight Stability Gate) 每天讓模型權重動態漂移/線上混合,有沒有帶來統計勝場,還是只增加換手率與過擬合?權重漂移全在捕捉隨機雜訊,等權重勝率更高
三 尺規一致門 (Metric Consistency Gate) 當評估尺規從 MSE 換成 QLIKE 或非對稱損失函數時,模型的優劣排名是否會翻轉?模型的優勢只存在於某把特定尺規,不具泛化穩健性
四 邊際成本門 (Marginal Cost Gate) 耗費幾十倍計算資源(MCMC 抽樣/深度 AI 基礎模型)換來的微小提升,是否跨過 嚴格統計-DM 統計門檻?付出高昂維護與算力成本,回報卻未達統計顯著性
  •  基準比較門 :我已經拿新模型跟只有 2-3 個參數的傳統 Baseline 進行樣本外 兩模型比較顯著 檢定。
  •  權重穩定門 :我驗證過動態權重調整的表現,確信它贏過簡單的等權重平均(Equal-Weighting)或靜態裁減。
  •  尺規一致門 :我在至少兩把不同物理意義的損失函數(如 MSE 與 Patton QLIKE)下核對過排名,確認沒有出現相反的方向訊號。
  •  邊際成本門 :新模型帶來的點預測提升已跨過 嚴格統計 統計顯著門檻,足以合理化額外增加的算力與維護複雜度。

四關全過,新模型才有資格進入你的正式投組;只要卡在任何一關,最務實的選擇就是把它留留在研發實驗室,繼續使用簡單穩健的 Baseline。

下面我們結合八篇本土與跨國量化實證,逐門拆解。


第一門:基準比較門,複雜機制真的打得贏一行老公式嗎?

當研究者對舊模型感到不滿時,第一個直覺往往是「多加一層狀態切換」或「讓參數隨時間平滑過渡」。

在 〈把市場拆成四層開關:贏了兩狀態切換,也贏了教科書模型,卻沒贏過一行老公式〉 裡,我們測試了一套理論極其優雅的「多重碎形 / 多層狀態開關模型」。這套模型假設市場波動的記憶不只一層:短線有新聞與當沖追價,長線有利率與資金循環。研究者估計了跨美股大盤(SPY)、科技股(QQQ)、黃金(GLD)、長債(TLT)與台股(0050.TW)共 5 檔資產,樣本外合計  9,351 筆逐日預測 。

結果如何?這套四層開關模型確實贏了傳統的兩狀態切換模型,也贏了陽春教科書版,但在最終樣本外對決中, 它依然沒有打贏只有三個參數的老牌 HAR-RV 與 GJR-GARCH 公式 。

類似的教訓發生在 Smooth Transition GARCH(STGARCH)上。在 〈把 GARCH 改聰明反而更笨:3 種 STGARCH 在 SPY 上全輸給老派 GJR〉 中,我們嘗試讓 GARCH 的係數依照市場狀態(分別以 VIX、絕對報酬、滯後波動率作為平滑切換指標)進行動態過渡。在 SPY 2023 年至 2024 年共 502 個樣本外交易日的嚴格測試中,這 3 種「變聰明」的 STGARCH 變體,QLIKE 評分 全數輸給了最老派的 GJR-GARCH 。

5 模型 QLIKE 樣本外比較

為什麼加了多重開關或平滑切換,預測反而更笨?因為在樣本內估計時,多出來的參數非常擅長「解釋」過去的歷史噪音;但一進到樣本外,這些敏感的切換機制就變成了預測特性的脆弱點。

 第一門的判決:任何複雜機制在上線前,必須先放在 3 參數老 Baseline(如 HAR-RV 或 GJR-GARCH)隔壁跑 OOS 對戰。如果連老 Baseline 都打不贏,模型再優雅也只是精美的負擔。 


第二門:權重穩定門,天天動態調整權重,真的比較聰明嗎?

如果你手頭有四五個表現都不錯的模型,下一個誘人的想法是:「我不選單一模型,我讓它們每天依據近期表現動態調整權重(Dynamic Weighting / Online Blending)。」

在 〈讓模型的權重每天自己漂移,隔天的波動會更好猜嗎?四格對戰輸掉三格,唯一贏的那格不能算〉 中,漂移的是另一種權重:同一條 HAR 預測式裡的係數,跟幾個模型之間怎麼分配無關。我們讓係數每收到一天新資料就微調一次(時變參數的卡爾曼濾波),在美股 SPY 與台股 0050 兩個市場上,跟每天把整段歷史重估一次的固定係數版本比。每個市場用兩把尺:事前登記的主要量尺 QLIKE,以及直接量變異數水準的次要量尺 MSE,一共四格。

結果: 會漂移的版本在四格裡輸掉三格 。兩個市場在主要量尺上,都是固定係數版本的損失比較低。唯一的正格是台股 0050 的次要量尺,但那把尺不是事前說好要看的,它的平均值又會被少數極端高波動日主導,所以不能算贏。模型在訓練階段自己挑漂移幅度時,挑的是候選值裡最小的那一個。讓係數每天跟著最新數據漂移,沒有換來更準的隔天預測。

進一步地,在 〈K1598:universal-portfolio 式線上 conformal 混合,96 個 DM 檢定只留下一個嚴格勝場〉 裡,我們採用 Cover 經典的 Universal Portfolio 演算架構(UP_AggACI_lite),對 12 檔美股 ETF 自 2016 年起每檔 2,633 個樣本外交易日進行線上 Conformal 區間校準。全矩陣一共執行了  96 個 嚴格統計 調整的 DM 統計檢定 ,在經過嚴格的 Holm-Bonferroni 多重比較校正後, 最終僅僅留下了 1 個嚴格勝場 。

甚至連模型裁減(Pruning)這件事,資料的完整度都遠比想像中關鍵。在 〈把四成六的樣本還回來之後,MCS 才淘汰得掉一個模型〉 中,我們利用模型信心集(Model Confidence Set, MCS)對 8 個候選模型進行篩選。當歷史資料被截斷缺漏時,雜訊會淹沒模型之間的真正差距;而當我們把 46% 的缺失歷史樣本補齊後,在 10% 的顯著水準下,MCS  最終也僅成功淘汰了 1 個模型 ,其餘 7 個模型全數留在同一個信心集內。

 第二門的判決:動態調整權重極易陷入「擬合昨天的噪音」之困境。在絕大多數情況下,簡單的「等權重平均」或「靜態保留優質 Baseline」比複雜的動態分配演算法更加穩健且節省交易成本。 


第三門:尺規一致門,小心評估工具一把換一把,排名全對調

假設你開發了一個新模型,在常用指標下表現極佳,這就代表它真的獲勝了嗎?

在 〈同一組預測,兩把尺指向相反方向:K1718 日本波動六格 NULL 的損失函數依賴性〉 裡,我們拿日經 225 指數(^N225,2,794 個交易日)與 TOPIX ETF(1306.T,2,815 個交易日)的數據,測試美股恐慌指數是否對日股具備增量預測力。

實驗揭示了一個極其關鍵的計量現象: 在完全相同的同一組預測值上,採用 Clark-West(基於均方誤差 MSE)與 Patton QLIKE 這兩把不同物理意義的評估尺規時,有兩格預測給出了方向完全相反的統計訊號! 

  • 用  MSE  評估時,模型 A 看起來顯著優於模型 B;
  • 換成  QLIKE  評估時,模型 B 卻反過來逆襲勝過模型 A。

為什麼會這樣?因為 MSE 採用平方誤差,對極端大波動高度敏感,且假設預測誤差的代價是對稱的;而 QLIKE 則是基於對數似然率導出的非對稱損失函數,專門懲罰「低估波動率」的危險行為(在風險管理中,低估波動往往比高估波動代價更高)。

如果你在研發時只看 MSE,你可能會選出一個極度害怕少數離群值、但在日常平靜期表現糟糕的模型;而如果你只看 QLIKE,你的選擇又會完全不同。

 第三門的判決:評估量化模型時,絕對不能依賴單一的通用純量(如純 MSE 或 R²)。你必須同時在物理意義明確的非對稱損失函數(如 Patton QLIKE)與風險控制尺規下進行交叉驗證。如果換一把尺排名就對調,說明該模型的優勢並不穩健。 


第四門:邊際成本門,巨額算力換來的些微提升,真的划算嗎?

最後,隨著 AI 與進階統計學的流行,越來越多團隊開始導入深度學習與貝氏抽樣。但在投入龐大算力與維護成本前,你必須問最後一個問題: 它換來的增量,是否跨過了 嚴格統計 統計顯著性門檻? 

在 〈AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來〉 裡,我們將 Google 的 TimesFM 與 IBM 的 TTM 這類最新的「時序基礎模型(Time-Series Foundation Models)」搬進波動率預測擂台。跨美股(SPY)、台股(0050)與台指期(TX)近十年、超過  7,000 個逐日預測 的實戰顯示:

  1.  直接 Zero-Shot 裸用的 AI 基礎模型,預測誤差在三個市場全數落後給傳統 HAR-A 老公式 ;
  2. 經過複雜事後校準或與 HAR 組隊後,AI 模型追平了成績,但 依然沒有超越簡單的 HAR-A ;
  3. 為了維護深度學習模型所付出的算力與 API 成本,換來的淨勝場數為  0 。

同樣的現象也發生在貝氏統計上。在 〈用貝氏 MCMC 重新估計 GJR-GARCH,預測精度真的更好嗎?SPY 20 年資料給出意外答案〉 裡,我們拿 SPY 長達 20 年的日報酬資料,分別用傳統最大概似法(MLE)與貝氏 MCMC(馬可夫鏈蒙地卡羅)重新估計 GJR-GARCH 模型。

結果顯示:在點預測精度上,MLE 的 QLIKE 點排名依舊保持第一;貝氏最佳變體(Median)的 QLIKE 評分略差 0.12%,且 差距完全沒有跨過 嚴格統計 調整的 t > 3 嚴格統計門檻 。耗費了幾十倍的 MCMC 抽樣算力與數個小時的計算時間,在下一天的點預測精度上沒有換到任何顯著的好處(儘管貝氏法在輸出區間不確定性時仍有其理論價值)。

 第四門的判決:算力與演算法的複雜度不是炫技的資本。如果一個耗費重金運行的 AI 基礎模型或貝氏抽樣,在樣本外的 嚴格統計-DM 檢定中無法帶來統計顯著的突破,那麼在實戰中維持輕量、簡潔且可解釋的 Baseline 才是最明智的工程選擇。 


總結:把四道檢查門套回你的交易系統

將這四道檢查門整理成綜合評估矩陣,你的模型庫應該長這樣:

實證案例新模型/機制名稱測試樣本規模實證結果檢查門判決
 K431 / K1819 多重碎形 / STGARCH 平滑切換9,351 筆 OOS / SPY 502 日全數輸給 3 參數 HAR-RV 與老派 GJR-GARCH 卡在第一門(基準比較門) :複雜機制未展現增量勝場
 K1598 / K1745 Conformal 線上混合 / 係數每日漂移的 HAR12 檔 ETF 2,633 日 / SPY 與 0050 兩市場 × 兩把尺96 區間僅 1 勝 / 四格輸三格,唯一正格不在事前登記的量尺 卡在第二門(權重穩定門) :多出來的適應性沒有換到樣本外勝場
 K1718 日本波動率預測 (MSE vs QLIKE)日經225 2,794 日 / TOPIX 2,815 日MSE 與 QLIKE 給出完全相反的統計訊號 卡在第三門(尺規一致門) :評估尺規改變導致排名翻轉
 K1378 / K1820 深度 AI 時序基礎模型 / 貝氏 MCMC7,000+ 日預測 / SPY 20 年數據點預測未打贏 HAR-A;MCMC 評分未過 嚴格統計 門檻 卡在第四門(邊際成本門) :高額算力未換來統計顯著提升

量化研究的樂趣在於探索未知,但交易系統的生命線在於控制脆弱性。

下次當你忍不住想為交易系統添加最新潮的 AI 模型或動態機制時,請先把這四道檢查門跑一遍。多數時候,你會發現系統給出的最佳解答是: 「保持簡單,把算力留給真正具備統計顯著性的增量訊號。」 


本期精選

  1. 〈讓模型的權重每天自己漂移,隔天的波動會更好猜嗎?四格對戰輸掉三格,唯一贏的那格不能算〉(2026-08-18)— SPY 與 0050 兩市場、兩把尺的四格對戰,係數每日漂移的版本輸三格,唯一正格落在非事前登記的量尺,第二門典型案例。
  2. 〈把四成六的樣本還回來之後,MCS 才淘汰得掉一個模型〉(2026-08-18)— 補齊 46% 歷史樣本後,MCS 在 8 個模型中僅淘汰 1 個,證明 Baseline 模型普遍具備強大生命力。
  3. 〈把市場拆成四層開關:贏了兩狀態切換,也贏了教科書模型,卻沒贏過一行老公式〉(2026-08-16)— 跨 5 檔資產 9,351 筆逐日預測,四層開關碎形模型全數未超越 3 參數 Baseline。
  4. 〈同一組預測,兩把尺指向相反方向:K1718 日本波動六格 NULL 的損失函數依賴性〉(2026-08-14)— 日經 225 跨 2,794 日實測,MSE 與 QLIKE 兩把尺給出相反方向訊號,第三門核心教材。
  5. 〈K1598:universal-portfolio 式線上 conformal 混合,96 個 DM 檢定只留下一個嚴格勝場〉(2026-08-09)— 12 檔 ETF 2,633 樣本外日,96 個 DM 檢定經 Holm 校正後僅留 1 勝場。
  6. 〈AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來〉(2026-07-27)— 跨三市場 7,000+ 筆預測,TimesFM 與 TTM 零樣本 AI 模型未打贏傳統 HAR-A。
  7. 〈把 GARCH 改聰明反而更笨:3 種 STGARCH 在 SPY 上全輸給老派 GJR〉(2026-06-16)— SPY 502 個 OOS 日對決,3 種平滑切換 STGARCH QLIKE 評分全數輸給老派 GJR-GARCH。
  8. 〈用貝氏 MCMC 重新估計 GJR-GARCH,預測精度真的更好嗎?SPY 20 年資料給出意外答案〉(2026-05-24)— 20 年 SPY 日數據實測,貝氏 MCMC 點預測未過 嚴格統計 DM 門檻,第四門實證標桿。

2026-09-15 更正說明:第二門的案例描述有誤

本文初版在第二門與總結表,把〈讓模型的權重每天自己漂移〉那篇研究寫成了另一件事,並掛錯實驗編號。對照該篇原文與它的實驗檔 experiments/K1745/K1745_results.json 後更正如下:

項目本文初版的說法實際情況
實驗編號K1830 K1745 (時變參數 HAR 對固定係數 HAR)。K1830 是推論降價後應用層軟體的已實現波動分解,與本文主題無關,而且本文發佈時它還不存在
比的是什麼線上 Conformal 混合、指數加權動態權重,對上固定等權重同一條 HAR 預測式的係數每天漂移,對上每天用整段歷史重估的固定係數,沒有模型之間的等權重
戰場SPY、QQQ、TLT、GLD 四個資產美股 SPY、台股 0050 兩個市場,各用主要與次要兩把尺,合計四格
唯一的正格GLD,且檢定不顯著台股 0050 的次要量尺;那把尺不是事前登記的主要量尺,而且該篇研究對這組比較沒有可用的正式檢定,所以本文也不再引用任何顯著性
結論等權重勝出會漂移的版本四格輸三格,兩個市場在主要量尺上都是固定係數版本較好

「四格輸三格、第二門的判決」這個結論方向不變,改的是案例本身的描述。K1598 那一半(12 檔 ETF、96 個檢定僅一個勝場)核對無誤,未更動。下方懶人包第二張圖已依本節重製,原本沿用初版說法的那一列已改成與上方總結表一致的敘述。


懶人包圖組

模型優化四道檢查門框架:基準比較門、權重穩定門、尺規一致門、邊際成本門,以及本期選文的篇數與時間跨度

八個模型實驗對戰數據:多碎形樣本外預測筆數、平滑切換 STGARCH 落敗數、動態權重每日漂移在四格檢定中的勝場數與格數、Conformal 區間 DM 勝場與 MCS 淘汰模型數

量化模型管理的實用建議,包含損失函數評估日經與 TOPIX 的樣本數、貝氏 MCMC 評分落差與 嚴格統計 門檻

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
低波動 ETF 和高貝塔 ETF 最近變得同進同退了嗎?預先註冊的檢定沒有找到證據
市場上有一種說法:防守型的低波動股票和進攻型的高貝塔股票,原本一個漲、一個跌,最近卻開始「同步走強」,兩者的關係進入了新階段。 我們把這個說法做成事先註冊的檢定,用 SPLV(低波動 ETF)和 SPHB(高貝塔 ETF)的日報酬,看扣掉大盤之後,兩者的相關有沒有出現結構性的移動。兩項檢定都沒有找到證據。 先講結論 沒有找到證據顯示相關出現新階段。 主配對 185 個月(2011 年 5 月至 2…
→
📄
今晚八點半非農公布:台指期夜盤公布後那三十分鐘,過去九年多比平常的晚上動得兇多少?
今晚台灣時間八點半(美東早上八點半,夏令時間),美國公布非農就業數據。台指期的夜盤在這一刻前後,波動會比平常大多少、又能撐多久? 我們把過去的非農夜一個一個翻出來,量了公布後三個三十分鐘的窗。先講清楚:這是回看過去的描述,不是預測今晚的方向或大小,今晚這一次也沒有放進任何數字。 先講結論 公布後的第一個三十分鐘,台指期夜盤的波動明顯放大。 把公布前三十分鐘當分母,事件夜公布後的升幅,是對照夜同一時…
→
📄
銀行收緊放款時,債券 ETF 劇烈震盪會讓隔天股市更不安嗎?十九年資料:不必另設一道警報
美國聯準會每一季會問各大銀行:最近對企業放款,標準是放寬還是收緊?當回答「收緊」的銀行明顯多過「放寬」,市場常把它當成信用變緊的訊號。一個常見的延伸想法是:在這種時期,高收益債或貸款類 ETF 一旦出現劇烈震盪,隔天的股市就更容易跟著不安,所以要對債券 ETF 的動靜特別敏感,甚至提早減碼股票。 這篇回答的就是這個決策:銀行收緊放款的期間,要不要把債券 ETF 的單日劇烈波動,當成比平常更強的股市…
→