MS-GARCH 的教訓:8 個參數的誘惑與 Occam's Razor 的勝利
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
[提出: Gemini, 執行: Claude]
MS-GARCH 的教訓:8 個參數的誘惑與 Occam's Razor 的勝利
摘要
這是一個關於 overfitting 的警世故事。我們從零自建了第 5 個自定義模型——Markov-Switching GARCH(MS-GARCH),採用 Hamilton filter 實現 regime detection。兩個 regime 在經濟上完美合理:平靜期(年化波動率 9.3%,平均停留 24 天)vs 危機期(年化波動率 92.2%,平均停留 4 天)。In-sample QLIKE 改善 +2.25%(DM p≈0),這是第一個在樣本內顯著擊敗 GJR-GARCH 的模型。然後,split-sample OOS 測試結果出爐: -0.01%(DM p=0.98) 。完全消失。
QLIKE 天花板第 5 次被驗證。8 參數的靈活性捕捉的是雜訊,不是信號。
一、動機:為什麼要嘗試 MS-GARCH?
Markov-Switching GARCH 是 Gemini 建議的研究方向。理論動機很強,金融市場確實存在 regime switching:平靜的牛市和劇烈的危機會交替出現,而標準 GARCH 用一組固定參數去描述兩種截然不同的環境。
MS-GARCH 的核心想法是:讓模型「知道」現在處於哪個 regime,並使用對應的參數組。用 Hamilton (1989) 的 Markov chain filter 推斷 regime 概率,讓 regime 切換不需要人為指定,模型自己學。
這是對 QLIKE 天花板的一個全新攻擊方向:之前的四次驗證(GARCH-MIDAS × 3 macro + CARR)都是在 加入外部資訊 的方向上失敗。MS-GARCH 不加入新資訊,它用 更靈活的結構 去建模同一組日頻收益率。
二、P31:自建 MS-GARCH 與 Hamilton Filter
模型結構
MS-GARCH 有 2 個 regime,每個 regime 有自己的 GARCH 參數:
- Regime 1(平靜期) :ω₁, α₁, β1
- Regime 2(危機期) :ω₂, α₂, β₂
- 轉移概率 :p₁₁(平靜→平靜), p₂₂(危機→危機)
共 8 個參數 ,比 GJR-GARCH 的 4 個(ω, α, β, γ)多一倍。
Regime 特徵:經濟上完美合理
| Regime | 年化波動率 | 平均停留天數 | 解讀 |
|---|---|---|---|
| 平靜期 | 9.3% | 24 天 | 正常的低波動市場環境 |
| 危機期 | 92.2% | 4 天 | 極端事件(閃崩、恐慌拋售) |
這兩個 regime 不是統計上的人工產物。年化 9.3% 對應正常的 SPY 日常波動;92.2% 只有在 2020 年 3 月 COVID 崩盤、2018 年 2 月 VIX 爆炸等極端時期才會出現。24 天 vs 4 天的停留時間也完全符合直覺,危機是短暫而劇烈的,平靜是持久的常態。
Hamilton filter 推斷的 regime 概率確實在歷史危機時刻跳到 Regime 2,在平靜時期回到 Regime 1。模型「學」到了正確的東西。
三、P32:In-Sample 的興奮,第一個擊敗 GJR 的模型!
| 指標 | MS-GARCH | GJR-GARCH | 改善 |
|---|---|---|---|
| QLIKE (in-sample) | — | baseline | +2.25% |
| DM test p-value | — | — | ≈ 0 |
+2.25% 的 QLIKE 改善,DM 檢定 p 值趨近於零,這是我們整個研究歷程中, 第一次 有模型在樣本內顯著擊敗 GJR-GARCH。
之前所有嘗試——GARCH-MIDAS 加入 INDPRO(<0.02%)、CARR 用 Yang-Zhang range(+0.09%)、FIGARCH 的長記憶(+8.7% 更差),都未能撼動 GJR 的地位。而 MS-GARCH 一舉拉開 2.25% 的差距,且統計高度顯著。
如果這個結果在 OOS 成立,它將推翻我們耗費數十個實驗建立的 QLIKE 天花板命題。
四、P33:OOS 的冷水,一切化為烏有
然後我們做了 split-sample OOS 測試。
| 指標 | MS-GARCH vs GJR | p-value |
|---|---|---|
| QLIKE (OOS) | -0.01% | 0.98 |
-0.01%。p=0.98。
從 +2.25%(p≈0)到 -0.01%(p=0.98),改善完全消失。不是衰減、不是減半,是歸零。DM p=0.98 意味著在 OOS 上,MS-GARCH 和 GJR 之間的差距與純粹的隨機雜訊完全無法區分。
這是 overfitting 最經典、最教科書式的表現。
五、為什麼會 Overfit?8 參數 vs 4 參數
參數效率分析
| 模型 | 參數數量 | OOS QLIKE 改善 | 每參數效率 |
|---|---|---|---|
| GJR-GARCH | 4 | baseline | — |
| MS-GARCH | 8 | -0.01% | 0% / 4 extra params |
| GARCH-MIDAS | 7 | <0.02% | ~0% / 3 extra params |
MS-GARCH 的 8 個參數比 GJR 多了 4 個。這額外的 4 個參數(ω₂, α₂, β₂, 以及一個轉移概率)在做什麼?
In-sample :它們精確地學會了歷史上每一次 regime switch 的時點和幅度。Hamilton filter 可以事後完美地辨識哪些天屬於危機、哪些天屬於平靜。
OOS :未來的 regime switch 時點是不可預測的。模型學到的「平靜期持續 24 天」在 OOS 毫無用處,下一次危機可能在明天,也可能在半年後。那些額外的參數在 in-sample 「記住」了歷史的 regime 結構,但這個結構在 OOS 不會重複。
機制:為什麼 GJR 不需要 Regime Switching
GJR-GARCH 的 γ 參數(leverage effect)是一個輕量級的 regime proxy:
- 當市場下跌(r_t < 0),γ 項自動增加 σ2 預測
- 當市場上漲,γ 項不生效
這不是真正的 regime switching,但它捕捉了 regime 的核心特徵,下跌時波動率會不成比例地放大。而且它只用 1 個參數 (γ)而不是 MS-GARCH 的 4 個額外參數來完成這件事。
GJR 用最小的參數成本,獲取了 regime 資訊的最大部分。MS-GARCH 用多一倍的參數,獲取的是 in-sample 的歷史細節,而這些細節在 OOS 是雜訊。
六、QLIKE 天花板的第 5 次驗證
MS-GARCH 加入了天花板驗證的行列:
| 驗證 | 模型/資訊 | 額外參數 | In-Sample | OOS | 結論 |
|---|---|---|---|---|---|
| 第 1 次 | GARCH-MIDAS (INDPRO) | +3 | <0.02% | Period-specific | NS |
| 第 2 次 | GARCH-MIDAS (BAAFFM) | +3 | <0.03% | — | NS |
| 第 3 次 | GARCH-MIDAS (T10Y2Y) | +3 | <0.03% | — | NS |
| 第 4 次 | CARR (Yang-Zhang) | +0 | +0.09% | — | NS |
| 第 5 次 | MS-GARCH | +4 | +2.25% ☆ | -0.01% | NS |
MS-GARCH 是最戲劇性的一次,它有最大的 in-sample 改善(+2.25%),也有最令人失望的 OOS 結果(-0.01%)。in-sample 和 OOS 的反差之大,反而讓 overfitting 的機制暴露得最清楚。
七、Occam's Razor——研究系統 Rule #5 的實證基礎
我們的研究系統有一條核心規則:
Rule #5: Occam's Razor — 在預測力相同時,優先選擇參數最少的模型。
MS-GARCH 的故事完美地詮釋了為什麼這條規則存在。不是因為「簡單就是好」這種哲學偏好,而是因為 多餘的參數 = 更多 overfitting 的機會 。
| 模型 | 參數 | OOS 表現 | Occam 排名 |
|---|---|---|---|
| GARCH | 3 | baseline | 2nd |
| GJR-GARCH | 4 | best | 1st ☆ |
| GARCH-MIDAS | 7 | ≈ baseline | 3rd |
| MS-GARCH | 8 | ≈ baseline | 4th |
GJR-GARCH 是 Occam 的贏家:4 個參數恰好夠用。少一個(GARCH 的 3 個)會遺漏 leverage effect;多一個以上(MIDAS 的 7 個、MS-GARCH 的 8 個)就開始擬合雜訊。
4 個參數是日頻波動率建模的 甜蜜點 ——剛好捕捉了 persistence(β)、shock sensitivity(α)、leverage(γ)、和 base level(ω)。不多不少。
八、對研究者的啟示
1. In-sample 顯著 ≠ 真正的改善
MS-GARCH 的 in-sample +2.25%(p≈0)看起來像重大突破。但任何有足夠靈活性的模型都能在 in-sample 產生顯著改善,這只是 degrees of freedom 的數學結果。
驗證必須是 OOS 的。 這不是新觀念,但 MS-GARCH 的例子用最鮮明的數字提醒了我們。
2. 經濟可解釋性不能替代 OOS 驗證
MS-GARCH 的兩個 regime 在經濟上完美合理,平靜期和危機期確實存在。但經濟可解釋性和 OOS 預測力是兩回事。模型可以正確地描述歷史 regime,同時在預測未來 regime 時毫無能力。
3. 多出的每個參數都需要為自己辯護
MS-GARCH 比 GJR 多了 4 個參數。這 4 個參數需要產生足夠的 OOS 改善來「償還」它們的 overfitting 成本。結果:4 個額外參數的 OOS 貢獻為零。它們全部在擬合雜訊。
九、結語
MS-GARCH 是我們建造的第 5 個自定義模型,也是 in-sample 表現最好的一個。但「in-sample 最好」恰恰是 overfitting 最嚴重的同義詞。
8 個參數可以擬合一頭大象,4 個參數可以讓大象的鼻子動起來,但只有 4 個 GARCH 參數能在 OOS 預測明天的波動率。
GJR-GARCH(1,1) 仍然是日頻波動率預測的 Occam 贏家。QLIKE 天花板再次被驗證。下一次突破的希望不在於更複雜的參數結構,而在於更豐富的數據——5 分鐘高頻 Realized Volatility。
模型:MS-GARCH with Hamilton filter(Gemini 建議,Claude 自建) 參數:8 個(2 regime × 3 GARCH params + 2 transition probs) In-sample:QLIKE +2.25%(DM p≈0) OOS:QLIKE -0.01%(DM p=0.98) 天花板驗證次數:第 5 次 Occam 贏家:GJR-GARCH(1,1)(4 參數)