K988:VIX² 在 17 個規格比較中 QLIKE 最低——對 GJR 的顯著性取決於對照組與視窗
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
[提出: 用戶, 執行: Claude]
摘要
K988 系統性比較了 17 個 Multiplicative GARCH-X 規格,問的是:當我們把 VIX 嵌入 GARCH 的乘法結構時,哪種規格的 QLIKE 最低?在原設定下,結果很清楚—— VIX²(平方)作為外生因子,搭配自由估計的截距項(free ω),勝出所有設計,DM t 統計量 = 4.49,遠超 Harvey (2016) 的 t > 3.0 門檻 。這個顯著性只在原設定下成立:2,000 日滾動視窗,GJR 對照組用三個由樣本變異數導出的起點估計。後續兩項稽核把這兩個設定拆開檢查,對照組換成標準多起點估計、或視窗縮短,A4f 對 GJR 的顯著性都沒有成立,詳見〈範圍限定〉。更重要的是,這項研究同時揭示了日頻 GARCH-X 對 GARCH-MIDAS 的全面優勢。
研究背景
這場規格比較源於 K889 的方法論缺陷。K889 引入了 MF-GJR(VIX) 模型:
95267\sigma^2_t = au_t imes g_t95267
然而賴教授指出三個關鍵問題:
- 名不符實 :K889 宣稱基於 GARCH-MIDAS,但 τ 是日頻的且只用單一 lag VIX,沒有 MIDAS 的 Beta 加權結構
- 估計/OOS 不一致 :g 方程分母在估計時用 τ_t(同期),但 OOS 用 τ_{t-1}(前期),邏輯錯誤
- E(g) ≠ 1 問題 :VIX² 系統性高估 realized variance(VRP > 0),強制 ω = 1-α-γ/2-β 使 E(g) = 1 的約束不合理
K988 的設計目標是:在同一框架下,系統性地測試所有合理的規格選擇,找出最佳設定。
方法與數據
| 項目 | 設定 |
|---|---|
| 資產 | SPY(標普 500 ETF) |
| 期間 | 2005–2026(yfinance) |
| OOS 窗口 | 2019-01-01 至 2026-04-07(1,825 觀測值) |
| 訓練窗口 | 2,000 個交易日(滾動) |
| 重新估計頻率 | 每 63 個交易日 |
| 評估指標 | QLIKE(Patton 2011)、DM 統計量(Harvey t > 3.0) |
| VIX | lagged 1 day(正確無 lookahead) |
共測試 17 個規格,分為三組:
- Part A :Multiplicative GARCH-X(日頻 τ,無 MIDAS Beta 加權)
- Part B :正規 GARCH-MIDAS(Rolling window,VIX 的 Beta 加權移動平均)
- Part C :Fixed-span GARCH-MIDAS(固定長度 span)
- Benchmark :GJR-GARCH(1,1)
核心發現
排名(表格為節錄,完整 17 個規格見圖)

| Rank | 模型 | QLIKE | DM t vs GJR | 類型 |
|---|---|---|---|---|
| 1 | A4f: VIX², free ω | -8.3606 | +4.49 ★ | GARCH-X, VIX², 自由截距 |
| 2 | A4: VIX², 約束 ω | -8.3599 | +4.32 ★ | GARCH-X, VIX² |
| 3 | A2: log-exp, τ_t 分母 | -8.3581 | +3.50 ★ | GARCH-X, log-exp |
| 4 | B1: MIDAS, K=22 | -8.3539 | +3.35 ★ | GARCH-MIDAS, 月 |
| 6 | A1: K889 原版(有 bug) | -8.3519 | +3.20 ★ | 估計/OOS 不一致 |
| 7 | A2f: log-exp, free ω | -8.3517 | +3.21 ★ | GARCH-X, log-exp, 自由截距 |
| 8 | A3: log-exp, τ_{t-1} | -8.3504 | +3.16 ★ | GARCH-X, 前期分母 |
| 17 | B0: GJR(基準) | -8.2806 | — | 純 GARCH |
發現一:VIX² 贏過 log-exp,因為維度一致
這是 K988 最重要的理論洞見。
在 Multiplicative 模型中,τ 代表「外生波動率水準」,σ² 是 variance(方差)。如果 τ = exp(θ₀ + θ₁ log VIX),維度是 VIX 的某次方 ;但如果 τ = θ₀ + θ₁ VIX²,維度直接對應 variance (因為 VIX ≈ σ,所以 VIX² ≈ σ²)。
維度一致帶來更佳的信號質量,這正是 A4/A4f 在 QLIKE 排名領先的根本原因。
發現二:Free ω 對 VIX² 模型有效,對 log-exp 無效
- VIX² + free ω(A4f)> VIX²(A4) :QLIKE -8.3606 vs -8.3599
- log-exp + free ω(A2f)< log-exp(A2) :QLIKE -8.3517 vs -8.3581
為什麼?VIX 有 隱含波動率風險溢酬(VRP) ——VIX² 系統性高估 realized variance,因此強制 E(g) = 1 的約束(ω = 1-α-γ/2-β)不合理。Free ω 讓模型自行校正這個偏差,所以有效。log-exp 模型的 τ 不是直接的 variance 量,VRP 偏差不那麼系統化,free ω 反而多一個自由度增加估計雜訊。
發現三:日頻 GARCH-X 全面勝過 GARCH-MIDAS
這項發現對方法論選擇有直接影響:
- Rolling window MIDAS(B1-B3) :最佳 QLIKE = -8.3539,弱於日頻 A2(-8.3581)
- Fixed-span MIDAS(C1-C3) :最佳 QLIKE = -8.3097,更差
原因在於:VIX 的信息高度集中在近期(short memory),MIDAS 加權把遠期 VIX 也納入,稀釋了近期信號。日頻 GARCH-X 直接用最新的 VIX_{t-1},不做任何加權平均,反而保留了最大的預測力。
結論:當外生變數本身就是高頻(每日)且記憶短時,GARCH-X 優於 GARCH-MIDAS。
發現四:修正 K889 bug 後績效確實提升
A1(K889 原版,有 bug)vs A2(修正一致性):QLIKE -8.3519 vs -8.3581。 估計/OOS 不一致的 off-by-one 確實損失了預測績效,驗證了 K889 批評的正確性。
VRP 連結(補充發現)
這一節檢查 g 成分是否追蹤波動率風險溢酬(VRP)。VRP 代理為 (VIX_{t-1}/100)²/252 − r_t²,g 取各規格真正的 g_t 遞迴路徑。數字取自 K988 重新凍結後的第二階段結果檔 experiments/k988/k988b_results.json,樣本外 n = 1,825;該檔的 VRP 分析涵蓋下列三個規格:
| 規格 | g 與 VRP 的 Spearman ρ | 顯著性(p 值) |
|---|---|---|
| A3f(τ_{t-1} 分母) | −0.113 | 1.4e-6 |
| A2n(log-exp 方案B) | −0.001 | 0.963 |
| A4n(VIX² 方案B) | +0.020 | 0.401 |

三個規格的 g 成分都無法實用地追蹤 VRP。 A3f 在統計上顯著(p = 1.4e-6),方向是負的,幅度小(ρ 約 −0.11);A2n 與 A4n 的 ρ 貼著零,也不顯著。
「乘法結構 + GARCH = VRP 的 AR 模型」這個理論橋樑因此得不到支持。
實務意義
對波動率預測模型設計者 :
- 當外生變數是隱含波動率(VIX 類)時,優先用 VIX² 而非 log(VIX) 作為 τ,維度一致性有實際預測價值
- 估計和 OOS 的分母設定必須一致,K889 式的 off-by-one bug 會損失績效
- GARCH-MIDAS 的複雜 Beta 加權在日頻外生變數場景下不帶來額外好處
對量化研究者 : 4. A4f 的 QLIKE 點估計在比較的規格中最低;DM t = 4.49 在原設定下過 Harvey t > 3.0 門檻,但這個顯著性不穩健(見〈範圍限定〉),只能讀成「點估計較低、統計上未確立」 5. QLIKE 差距看似微小(-8.36 vs -8.28),在原設定的 1,825 個 OOS 點上累積出顯著的差異;對照組換成標準估計後,差距仍在(約 1.16%),但顯著性不足(見〈範圍限定〉)
下一步 :
- 跨資產驗證(QQQ/EEM/0050.TW/GLD)
- 結合 VaR/ES 評估框架(Patton 2011 標準)
範圍限定:對照組估計與視窗長度(後續稽核)
這篇的 DM t = 4.49 是在一組特定設定下得到的:滾動視窗 2,000 日,GJR 對照組用三個由樣本變異數導出的起點估計。後續兩項獨立稽核把這兩個設定拆開檢查,結果都不支持把 4.49 讀成穩健的強顯著。
對照組換成標準估計。 只把 GJR 對照組改用標準的 20 起點多起點擬合、其餘全部不動,同一格的 DM t 由 4.49 降到 2.56(GW 檢定 p 值由 0.00004 變 0.037),不再通過 t > 3.0 門檻;A4f 的 QLIKE 優勢點估計仍為正(約 1.16%,原設定約 0.97%)。這個稽核的事前規則把該格標為「未定」:兩份凍結快照之間的 DM t 差距超過事前容差,所以結論是未確立,不是被推翻。
視窗縮短。 預註冊的視窗長度稽核(SPY,沿用原三起點 GJR 對照組,OOS 同一段)把視窗改為 500、1,000、1,500、2,000、3,000 日與 expanding,另加兩條彈性規則(逐日選視窗、六視窗平均)。以同一個 s 統計量(正值代表 A4f 較佳,門檻 3.0):視窗 500 日 −0.65、六視窗平均 +0.67,顯著性消失;1,500 日 2.75,落在門檻下方的噪音帶內;1,000 日 3.33 勉強過線(高出門檻不到一個噪音帶);2,000 日(原值)重現為 4.36,3,000 日 5.10,expanding 4.76,都過線。噪音帶 0.47,是同一條估計管線在輸入末位微擾下 s 的最大變動。
這兩項稽核的限定。 視窗稽核是非盲的預註冊(凍結前已看過原結論與基準敏感度的記載);判定只在預註冊的操作定義與噪音帶下成立;噪音帶量的是管線對輸入微擾的敏感度,不是 DM 估計的不確定度;「八格任一越界」的規則含多重尋找;輸入讀取路徑的修訂發生在已算出視窗 500 的擾動格之後。這些稽核不顯示哪個視窗較佳,也不表示 A4f 無效;它們只表示 4.49 這個數字依賴「2,000 日視窗」與「三起點 GJR 對照組」這兩個選擇。
結論
K988 的核心答案是: 在 Multiplicative GARCH-X 架構中,VIX²(平方)是最自然、最有效的外生波動率因子 。維度一致(variance 對 variance)、VRP 水準偏差由 free ω 校正、日頻更新(勝過 MIDAS 加權),三個設計選擇共同解釋了 A4f 的冠軍地位。這裡的「最有效」指點估計與模型排名;A4f 對 GJR 的統計顯著性在標準對照組與較短視窗下都沒有成立,見〈範圍限定〉。
局限性
- 僅測 SPY,尚未做跨資產驗證
- 未做 VaR/ES 評估(僅 QLIKE)
- Refit 頻率每 63 天,非每日
- OOS 期間(2019-2026)包含 COVID-19 極端波動,結果可能對非常規時期敏感
- 對照組估計與視窗長度:A4f 對 GJR 的顯著性依賴三起點 GJR 對照組與 2,000 日視窗,見〈範圍限定〉
- g 成分與 VRP 的關係:只有 A3f 一個規格呈統計顯著的負相關,幅度小(ρ 約 −0.11),g 不能當作追蹤 VRP 的工具(見〈VRP 連結〉一節)
實驗腳本: experiments/k988/k988.py,結果: experiments/k988/k988_results.json(數據來源:yfinance SPY/VIX 2005-2026,OOS n=1,825)