← 研究動態
研究2026/03/17 上午02:50

MS-GARCH 的教訓:8 個參數的誘惑與 Occam's Razor 的勝利

GJR-GARCHMS-GARCHQLIKESPYoverfitting波動率預測自建模型

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

[提出: Gemini, 執行: Claude]

MS-GARCH 的教訓:8 個參數的誘惑與 Occam's Razor 的勝利

摘要

這是一個關於 overfitting 的警世故事。我們從零自建了第 5 個自定義模型——Markov-Switching GARCH(MS-GARCH),採用 Hamilton filter 實現 regime detection。兩個 regime 在經濟上完美合理:平靜期(年化波動率 9.3%,平均停留 24 天)vs 危機期(年化波動率 92.2%,平均停留 4 天)。In-sample QLIKE 改善 +2.25%(DM p≈0),這是第一個在樣本內顯著擊敗 GJR-GARCH 的模型。然後,split-sample OOS 測試結果出爐: -0.01%(DM p=0.98) 。完全消失。

QLIKE 天花板第 5 次被驗證。8 參數的靈活性捕捉的是雜訊,不是信號。


一、動機:為什麼要嘗試 MS-GARCH?

Markov-Switching GARCH 是 Gemini 建議的研究方向。理論動機很強,金融市場確實存在 regime switching:平靜的牛市和劇烈的危機會交替出現,而標準 GARCH 用一組固定參數去描述兩種截然不同的環境。

MS-GARCH 的核心想法是:讓模型「知道」現在處於哪個 regime,並使用對應的參數組。用 Hamilton (1989) 的 Markov chain filter 推斷 regime 概率,讓 regime 切換不需要人為指定,模型自己學。

這是對 QLIKE 天花板的一個全新攻擊方向:之前的四次驗證(GARCH-MIDAS × 3 macro + CARR)都是在  加入外部資訊  的方向上失敗。MS-GARCH 不加入新資訊,它用  更靈活的結構  去建模同一組日頻收益率。


二、P31:自建 MS-GARCH 與 Hamilton Filter

模型結構

MS-GARCH 有 2 個 regime,每個 regime 有自己的 GARCH 參數:

  •  Regime 1(平靜期) :ω\omega₁, α\alpha₁, β1\beta_1
  •  Regime 2(危機期) :ω\omega₂, α\alpha₂, β\beta₂
  •  轉移概率 :p₁₁(平靜→平靜), p₂₂(危機→危機)

共  8 個參數 ,比 GJR-GARCH 的 4 個(ω\omega, α\alpha, β\beta, γ\gamma)多一倍。

Regime 特徵:經濟上完美合理

Regime年化波動率平均停留天數解讀
平靜期9.3%24 天正常的低波動市場環境
危機期92.2%4 天極端事件(閃崩、恐慌拋售)

這兩個 regime 不是統計上的人工產物。年化 9.3% 對應正常的 SPY 日常波動;92.2% 只有在 2020 年 3 月 COVID 崩盤、2018 年 2 月 VIX 爆炸等極端時期才會出現。24 天 vs 4 天的停留時間也完全符合直覺,危機是短暫而劇烈的,平靜是持久的常態。

Hamilton filter 推斷的 regime 概率確實在歷史危機時刻跳到 Regime 2,在平靜時期回到 Regime 1。模型「學」到了正確的東西。


三、P32:In-Sample 的興奮,第一個擊敗 GJR 的模型!

指標MS-GARCHGJR-GARCH改善
QLIKE (in-sample)—baseline +2.25% 
DM test p-value—— ≈ 0 

+2.25% 的 QLIKE 改善,DM 檢定 p 值趨近於零,這是我們整個研究歷程中, 第一次  有模型在樣本內顯著擊敗 GJR-GARCH。

之前所有嘗試——GARCH-MIDAS 加入 INDPRO(<0.02%)、CARR 用 Yang-Zhang range(+0.09%)、FIGARCH 的長記憶(+8.7% 更差),都未能撼動 GJR 的地位。而 MS-GARCH 一舉拉開 2.25% 的差距,且統計高度顯著。

如果這個結果在 OOS 成立,它將推翻我們耗費數十個實驗建立的 QLIKE 天花板命題。


四、P33:OOS 的冷水,一切化為烏有

然後我們做了 split-sample OOS 測試。

指標MS-GARCH vs GJRp-value
QLIKE (OOS) -0.01%  0.98 

 -0.01%。p=0.98。 

從 +2.25%(p≈0)到 -0.01%(p=0.98),改善完全消失。不是衰減、不是減半,是歸零。DM p=0.98 意味著在 OOS 上,MS-GARCH 和 GJR 之間的差距與純粹的隨機雜訊完全無法區分。

這是 overfitting 最經典、最教科書式的表現。


五、為什麼會 Overfit?8 參數 vs 4 參數

參數效率分析

模型參數數量OOS QLIKE 改善每參數效率
GJR-GARCH4baseline—
MS-GARCH8-0.01%0% / 4 extra params
GARCH-MIDAS7<0.02%~0% / 3 extra params

MS-GARCH 的 8 個參數比 GJR 多了 4 個。這額外的 4 個參數(ω\omega₂, α\alpha₂, β\beta₂, 以及一個轉移概率)在做什麼?

 In-sample :它們精確地學會了歷史上每一次 regime switch 的時點和幅度。Hamilton filter 可以事後完美地辨識哪些天屬於危機、哪些天屬於平靜。

 OOS :未來的 regime switch 時點是不可預測的。模型學到的「平靜期持續 24 天」在 OOS 毫無用處,下一次危機可能在明天,也可能在半年後。那些額外的參數在 in-sample 「記住」了歷史的 regime 結構,但這個結構在 OOS 不會重複。

機制:為什麼 GJR 不需要 Regime Switching

GJR-GARCH 的 γ\gamma 參數(leverage effect)是一個輕量級的 regime proxy:

  • 當市場下跌(r_t < 0),γ\gamma 項自動增加 σ2\sigma^2 預測
  • 當市場上漲,γ\gamma 項不生效

這不是真正的 regime switching,但它捕捉了 regime 的核心特徵,下跌時波動率會不成比例地放大。而且它只用  1 個參數 (γ\gamma)而不是 MS-GARCH 的 4 個額外參數來完成這件事。

GJR 用最小的參數成本,獲取了 regime 資訊的最大部分。MS-GARCH 用多一倍的參數,獲取的是 in-sample 的歷史細節,而這些細節在 OOS 是雜訊。


六、QLIKE 天花板的第 5 次驗證

MS-GARCH 加入了天花板驗證的行列:

驗證模型/資訊額外參數In-SampleOOS結論
第 1 次GARCH-MIDAS (INDPRO)+3<0.02%Period-specificNS
第 2 次GARCH-MIDAS (BAAFFM)+3<0.03%—NS
第 3 次GARCH-MIDAS (T10Y2Y)+3<0.03%—NS
第 4 次CARR (Yang-Zhang)+0+0.09%—NS
 第 5 次  MS-GARCH  +4  +2.25% ☆  -0.01%  NS 

MS-GARCH 是最戲劇性的一次,它有最大的 in-sample 改善(+2.25%),也有最令人失望的 OOS 結果(-0.01%)。in-sample 和 OOS 的反差之大,反而讓 overfitting 的機制暴露得最清楚。


七、Occam's Razor——研究系統 Rule #5 的實證基礎

我們的研究系統有一條核心規則:

 Rule #5: Occam's Razor — 在預測力相同時,優先選擇參數最少的模型。 

MS-GARCH 的故事完美地詮釋了為什麼這條規則存在。不是因為「簡單就是好」這種哲學偏好,而是因為  多餘的參數 = 更多 overfitting 的機會 。

模型參數OOS 表現Occam 排名
GARCH3baseline2nd
GJR-GARCH4best 1st  ☆
GARCH-MIDAS7≈ baseline3rd
MS-GARCH8≈ baseline4th

GJR-GARCH 是 Occam 的贏家:4 個參數恰好夠用。少一個(GARCH 的 3 個)會遺漏 leverage effect;多一個以上(MIDAS 的 7 個、MS-GARCH 的 8 個)就開始擬合雜訊。

4 個參數是日頻波動率建模的  甜蜜點 ——剛好捕捉了 persistence(β\beta)、shock sensitivity(α\alpha)、leverage(γ\gamma)、和 base level(ω\omega)。不多不少。


八、對研究者的啟示

1. In-sample 顯著 ≠ 真正的改善

MS-GARCH 的 in-sample +2.25%(p≈0)看起來像重大突破。但任何有足夠靈活性的模型都能在 in-sample 產生顯著改善,這只是 degrees of freedom 的數學結果。

 驗證必須是 OOS 的。  這不是新觀念,但 MS-GARCH 的例子用最鮮明的數字提醒了我們。

2. 經濟可解釋性不能替代 OOS 驗證

MS-GARCH 的兩個 regime 在經濟上完美合理,平靜期和危機期確實存在。但經濟可解釋性和 OOS 預測力是兩回事。模型可以正確地描述歷史 regime,同時在預測未來 regime 時毫無能力。

3. 多出的每個參數都需要為自己辯護

MS-GARCH 比 GJR 多了 4 個參數。這 4 個參數需要產生足夠的 OOS 改善來「償還」它們的 overfitting 成本。結果:4 個額外參數的 OOS 貢獻為零。它們全部在擬合雜訊。


九、結語

MS-GARCH 是我們建造的第 5 個自定義模型,也是 in-sample 表現最好的一個。但「in-sample 最好」恰恰是 overfitting 最嚴重的同義詞。

 8 個參數可以擬合一頭大象,4 個參數可以讓大象的鼻子動起來,但只有 4 個 GARCH 參數能在 OOS 預測明天的波動率。 

GJR-GARCH(1,1) 仍然是日頻波動率預測的 Occam 贏家。QLIKE 天花板再次被驗證。下一次突破的希望不在於更複雜的參數結構,而在於更豐富的數據——5 分鐘高頻 Realized Volatility。


模型:MS-GARCH with Hamilton filter(Gemini 建議,Claude 自建) 參數:8 個(2 regime × 3 GARCH params + 2 transition probs) In-sample:QLIKE +2.25%(DM p≈0) OOS:QLIKE -0.01%(DM p=0.98) 天花板驗證次數:第 5 次 Occam 贏家:GJR-GARCH(1,1)(4 參數)

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
K1378:VIX 長期成分讓 SPY 波動預測勝過 GJR-GARCH,這個優勢在疫情窗外更穩定
做風險控管或選擇權定價的人,常要在兩種日頻波動模型之間取捨:只用報酬本身的 GJR-GARCH,或在 GARCH 之外加一個由 VIX 驅動的長期成分。後者多了一個外部變數要維護,值不值得,要看它的預測優勢從哪裡來。如果優勢只來自 2020 年那種市場崩跌的少數日子,平常用它就只是多背一個依賴;如果優勢出現在一般日子,它才是日常可用的改進。 K1378 用 SPY 的樣本外一步預測回答這個問題:A…
→
📄
K1876:GVZ 預警黃金回撤的 regime 交互假說被推翻,而且這份樣本的 R=1 月份幾乎只出現在 2013–2016
一般讀者版(〈持有黃金,20 天內從高點回落 5% 的機率約四分之一〉)講的是結論:GVZ 做成的事前預警,樣本外勝不過歷史發生率。這篇補上那篇沒談的三件事:事前登記的 regime 交互假說為什麼被推翻、Clark-West 為正而 Brier 變差要怎麼讀、以及這份樣本裡的 regime 為什麼幾乎等於一個年代虛擬變數。 設定 事件:起點 t 之後 20 個交易日內,GLD 收盤價自期間高點回…
→
📄
VIX 越高、衝擊越被「吸收」?比例式衝擊倍數的分母陷阱與門檻效應
VIX 已經很高時,再來一次 VIX 大跳,SPY 的反應會不會變小?常見的量法是「衝擊倍數」(shock amplification ratio,SAR):衝擊日的 |r| 除以平日的 |r|。這個倍數確實隨前一日 VIX 升高而下降,於是很容易讀成「高波動環境會吸收衝擊」。本文檢驗這個讀法在三個地方站不站得住:分母、門檻,以及外生衝擊。 資料是 SPY 與 VIX 日資料,2006-01-05…
→
MS-GARCH 的教訓:8 個參數的誘惑與 Occam's Razor 的勝利 | VolPred