← 研究動態
研究2026/04/11 上午04:03

K988:VIX² 在 17 個規格比較中 QLIKE 最低——對 GJR 的顯著性取決於對照組與視窗

GARCHGARCH-MIDASSPYVIX波動率預測GARCH-X模型比較Patton 2011

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

[提出: 用戶, 執行: Claude]

摘要

K988 系統性比較了 17 個 Multiplicative GARCH-X 規格,問的是:當我們把 VIX 嵌入 GARCH 的乘法結構時,哪種規格的 QLIKE 最低?在原設定下,結果很清楚—— VIX²(平方)作為外生因子,搭配自由估計的截距項(free ω),勝出所有設計,DM t 統計量 = 4.49,遠超 Harvey (2016) 的 t > 3.0 門檻 。這個顯著性只在原設定下成立:2,000 日滾動視窗,GJR 對照組用三個由樣本變異數導出的起點估計。後續兩項稽核把這兩個設定拆開檢查,對照組換成標準多起點估計、或視窗縮短,A4f 對 GJR 的顯著性都沒有成立,詳見〈範圍限定〉。更重要的是,這項研究同時揭示了日頻 GARCH-X 對 GARCH-MIDAS 的全面優勢。


研究背景

這場規格比較源於 K889 的方法論缺陷。K889 引入了 MF-GJR(VIX) 模型:

95267\sigma^2_t = au_t imes g_t95267

然而賴教授指出三個關鍵問題:

  1.  名不符實 :K889 宣稱基於 GARCH-MIDAS,但 τ 是日頻的且只用單一 lag VIX,沒有 MIDAS 的 Beta 加權結構
  2.  估計/OOS 不一致 :g 方程分母在估計時用 τ_t(同期),但 OOS 用 τ_{t-1}(前期),邏輯錯誤
  3.  E(g) ≠ 1 問題 :VIX² 系統性高估 realized variance(VRP > 0),強制 ω = 1-α-γ/2-β 使 E(g) = 1 的約束不合理

K988 的設計目標是:在同一框架下,系統性地測試所有合理的規格選擇,找出最佳設定。


方法與數據

項目設定
資產SPY(標普 500 ETF)
期間2005–2026(yfinance)
OOS 窗口2019-01-01 至 2026-04-07(1,825 觀測值)
訓練窗口2,000 個交易日(滾動)
重新估計頻率每 63 個交易日
評估指標QLIKE(Patton 2011)、DM 統計量(Harvey t > 3.0)
VIXlagged 1 day(正確無 lookahead)

共測試 17 個規格,分為三組:

  •  Part A :Multiplicative GARCH-X(日頻 τ,無 MIDAS Beta 加權)
  •  Part B :正規 GARCH-MIDAS(Rolling window,VIX 的 Beta 加權移動平均)
  •  Part C :Fixed-span GARCH-MIDAS(固定長度 span)
  •  Benchmark :GJR-GARCH(1,1)

核心發現

排名(表格為節錄,完整 17 個規格見圖)

K988 Multiplicative GARCH-X 17 個規格的 QLIKE 排名圖(越負越好)

Rank模型QLIKEDM t vs GJR類型
 1  A4f: VIX², free ω  -8.3606  +4.49  ★GARCH-X, VIX², 自由截距
2A4: VIX², 約束 ω-8.3599+4.32 ★GARCH-X, VIX²
3A2: log-exp, τ_t 分母-8.3581+3.50 ★GARCH-X, log-exp
4B1: MIDAS, K=22-8.3539+3.35 ★GARCH-MIDAS, 月
6A1: K889 原版(有 bug)-8.3519+3.20 ★估計/OOS 不一致
7A2f: log-exp, free ω-8.3517+3.21 ★GARCH-X, log-exp, 自由截距
8A3: log-exp, τ_{t-1}-8.3504+3.16 ★GARCH-X, 前期分母
17B0: GJR(基準)-8.2806—純 GARCH

發現一:VIX² 贏過 log-exp,因為維度一致

這是 K988 最重要的理論洞見。

在 Multiplicative 模型中,τ 代表「外生波動率水準」,σ² 是 variance(方差)。如果 τ = exp(θ₀ + θ₁ log VIX),維度是  VIX 的某次方 ;但如果 τ = θ₀ + θ₁ VIX²,維度直接對應  variance (因為 VIX ≈ σ,所以 VIX² ≈ σ²)。

維度一致帶來更佳的信號質量,這正是 A4/A4f 在 QLIKE 排名領先的根本原因。

發現二:Free ω 對 VIX² 模型有效,對 log-exp 無效

  •  VIX² + free ω(A4f)> VIX²(A4) :QLIKE -8.3606 vs -8.3599
  •  log-exp + free ω(A2f)< log-exp(A2) :QLIKE -8.3517 vs -8.3581

為什麼?VIX 有 隱含波動率風險溢酬(VRP) ——VIX² 系統性高估 realized variance,因此強制 E(g) = 1 的約束(ω = 1-α-γ/2-β)不合理。Free ω 讓模型自行校正這個偏差,所以有效。log-exp 模型的 τ 不是直接的 variance 量,VRP 偏差不那麼系統化,free ω 反而多一個自由度增加估計雜訊。

發現三:日頻 GARCH-X 全面勝過 GARCH-MIDAS

這項發現對方法論選擇有直接影響:

  •  Rolling window MIDAS(B1-B3) :最佳 QLIKE = -8.3539,弱於日頻 A2(-8.3581)
  •  Fixed-span MIDAS(C1-C3) :最佳 QLIKE = -8.3097,更差

原因在於:VIX 的信息高度集中在近期(short memory),MIDAS 加權把遠期 VIX 也納入,稀釋了近期信號。日頻 GARCH-X 直接用最新的 VIX_{t-1},不做任何加權平均,反而保留了最大的預測力。

 結論:當外生變數本身就是高頻(每日)且記憶短時,GARCH-X 優於 GARCH-MIDAS。 

發現四:修正 K889 bug 後績效確實提升

A1(K889 原版,有 bug)vs A2(修正一致性):QLIKE -8.3519 vs -8.3581。 估計/OOS 不一致的 off-by-one 確實損失了預測績效,驗證了 K889 批評的正確性。


VRP 連結(補充發現)

這一節檢查 g 成分是否追蹤波動率風險溢酬(VRP)。VRP 代理為 (VIX_{t-1}/100)²/252 − r_t²,g 取各規格真正的 g_t 遞迴路徑。數字取自 K988 重新凍結後的第二階段結果檔 experiments/k988/k988b_results.json,樣本外 n = 1,825;該檔的 VRP 分析涵蓋下列三個規格:

規格g 與 VRP 的 Spearman ρ顯著性(p 值)
A3f(τ_{t-1} 分母) −0.113 1.4e-6
A2n(log-exp 方案B) −0.001 0.963
A4n(VIX² 方案B) +0.020 0.401

K988b 三個規格的 g 成分與 VRP 的 Spearman 相關,A3f 為小幅負相關

 三個規格的 g 成分都無法實用地追蹤 VRP。  A3f 在統計上顯著(p = 1.4e-6),方向是負的,幅度小(ρ 約 −0.11);A2n 與 A4n 的 ρ 貼著零,也不顯著。

「乘法結構 + GARCH = VRP 的 AR 模型」這個理論橋樑因此得不到支持。


實務意義

 對波動率預測模型設計者 :

  1. 當外生變數是隱含波動率(VIX 類)時,優先用 VIX² 而非 log(VIX) 作為 τ,維度一致性有實際預測價值
  2. 估計和 OOS 的分母設定必須一致,K889 式的 off-by-one bug 會損失績效
  3. GARCH-MIDAS 的複雜 Beta 加權在日頻外生變數場景下不帶來額外好處

 對量化研究者 : 4. A4f 的 QLIKE 點估計在比較的規格中最低;DM t = 4.49 在原設定下過 Harvey t > 3.0 門檻,但這個顯著性不穩健(見〈範圍限定〉),只能讀成「點估計較低、統計上未確立」 5. QLIKE 差距看似微小(-8.36 vs -8.28),在原設定的 1,825 個 OOS 點上累積出顯著的差異;對照組換成標準估計後,差距仍在(約 1.16%),但顯著性不足(見〈範圍限定〉)

 下一步 :

  • 跨資產驗證(QQQ/EEM/0050.TW/GLD)
  • 結合 VaR/ES 評估框架(Patton 2011 標準)

範圍限定:對照組估計與視窗長度(後續稽核)

這篇的 DM t = 4.49 是在一組特定設定下得到的:滾動視窗 2,000 日,GJR 對照組用三個由樣本變異數導出的起點估計。後續兩項獨立稽核把這兩個設定拆開檢查,結果都不支持把 4.49 讀成穩健的強顯著。

 對照組換成標準估計。  只把 GJR 對照組改用標準的 20 起點多起點擬合、其餘全部不動,同一格的 DM t 由 4.49 降到 2.56(GW 檢定 p 值由 0.00004 變 0.037),不再通過 t > 3.0 門檻;A4f 的 QLIKE 優勢點估計仍為正(約 1.16%,原設定約 0.97%)。這個稽核的事前規則把該格標為「未定」:兩份凍結快照之間的 DM t 差距超過事前容差,所以結論是未確立,不是被推翻。

 視窗縮短。  預註冊的視窗長度稽核(SPY,沿用原三起點 GJR 對照組,OOS 同一段)把視窗改為 500、1,000、1,500、2,000、3,000 日與 expanding,另加兩條彈性規則(逐日選視窗、六視窗平均)。以同一個 s 統計量(正值代表 A4f 較佳,門檻 3.0):視窗 500 日 −0.65、六視窗平均 +0.67,顯著性消失;1,500 日 2.75,落在門檻下方的噪音帶內;1,000 日 3.33 勉強過線(高出門檻不到一個噪音帶);2,000 日(原值)重現為 4.36,3,000 日 5.10,expanding 4.76,都過線。噪音帶 0.47,是同一條估計管線在輸入末位微擾下 s 的最大變動。

 這兩項稽核的限定。  視窗稽核是非盲的預註冊(凍結前已看過原結論與基準敏感度的記載);判定只在預註冊的操作定義與噪音帶下成立;噪音帶量的是管線對輸入微擾的敏感度,不是 DM 估計的不確定度;「八格任一越界」的規則含多重尋找;輸入讀取路徑的修訂發生在已算出視窗 500 的擾動格之後。這些稽核不顯示哪個視窗較佳,也不表示 A4f 無效;它們只表示 4.49 這個數字依賴「2,000 日視窗」與「三起點 GJR 對照組」這兩個選擇。


結論

K988 的核心答案是: 在 Multiplicative GARCH-X 架構中,VIX²(平方)是最自然、最有效的外生波動率因子 。維度一致(variance 對 variance)、VRP 水準偏差由 free ω 校正、日頻更新(勝過 MIDAS 加權),三個設計選擇共同解釋了 A4f 的冠軍地位。這裡的「最有效」指點估計與模型排名;A4f 對 GJR 的統計顯著性在標準對照組與較短視窗下都沒有成立,見〈範圍限定〉。


局限性

  • 僅測 SPY,尚未做跨資產驗證
  • 未做 VaR/ES 評估(僅 QLIKE)
  • Refit 頻率每 63 天,非每日
  • OOS 期間(2019-2026)包含 COVID-19 極端波動,結果可能對非常規時期敏感
  • 對照組估計與視窗長度:A4f 對 GJR 的顯著性依賴三起點 GJR 對照組與 2,000 日視窗,見〈範圍限定〉
  • g 成分與 VRP 的關係:只有 A3f 一個規格呈統計顯著的負相關,幅度小(ρ 約 −0.11),g 不能當作追蹤 VRP 的工具(見〈VRP 連結〉一節)

實驗腳本: experiments/k988/k988.py,結果: experiments/k988/k988_results.json(數據來源:yfinance SPY/VIX 2005-2026,OOS n=1,825)

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
VIX 越高、衝擊越被「吸收」?比例式衝擊倍數的分母陷阱與門檻效應
VIX 已經很高時,再來一次 VIX 大跳,SPY 的反應會不會變小?常見的量法是「衝擊倍數」(shock amplification ratio,SAR):衝擊日的 |r| 除以平日的 |r|。這個倍數確實隨前一日 VIX 升高而下降,於是很容易讀成「高波動環境會吸收衝擊」。本文檢驗這個讀法在三個地方站不站得住:分母、門檻,以及外生衝擊。 資料是 SPY 與 VIX 日資料,2006-01-05…
→
📄
K1378:VIX 長期成分讓 SPY 波動預測勝過 GJR-GARCH,這個優勢在疫情窗外更穩定
做風險控管或選擇權定價的人,常要在兩種日頻波動模型之間取捨:只用報酬本身的 GJR-GARCH,或在 GARCH 之外加一個由 VIX 驅動的長期成分。後者多了一個外部變數要維護,值不值得,要看它的預測優勢從哪裡來。如果優勢只來自 2020 年那種市場崩跌的少數日子,平常用它就只是多背一個依賴;如果優勢出現在一般日子,它才是日常可用的改進。 K1378 用 SPY 的樣本外一步預測回答這個問題:A…
→
📄
K1874:SPY/GLD 波動縮放規則的黃金腿,Sharpe 改善來自脫離 VIX,GVZ 沒有增量
一般讀者版〈股市恐慌時,黃金要不要跟著一起減碼?〉給的是配置結論:黃金腿不要跟著 VIX 一起縮放。這篇處理同一個實驗的方法問題:以 VIX 縮放 SPY/GLD 兩條腿的規則,把黃金腿換成自己的恐慌指數 GVZ 之後 Sharpe 上升,這個改善有多少來自 GVZ 的資訊,有多少只是黃金腿不再被 VIX 牽動? 這個區分決定了下一步要做什麼。若改善來自 GVZ,值得投入的是更好的黃金波動預測;若…
→