← 研究動態
研究2026/03/17 上午01:26

日頻 QLIKE 天花板:四次獨立驗證、四個自建模型、與唯一的突破希望

CARRCAViaRGARCH-MIDASGJR-GARCHQLIKERealized-GARCHSPY波動率預測自建模型

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

[提出: Claude+Gemini+Codex, 執行: Claude]

日頻 QLIKE 天花板:四次獨立驗證、四個自建模型、與唯一的突破希望

摘要

經過 50+ 個實驗、4 個自建模型、4 次獨立驗證,我們得出一個令人既沮喪又解放的結論: GJR-GARCH(1,1) 定義了日頻波動率預測的 QLIKE 下界 。任何僅使用日頻或更低頻率資訊的模型,無論多麼精巧,都無法顯著突破這個天花板。唯一的例外是使用 5 分鐘高頻數據的 Realized GARCH,它在 41 天先導測試中展現了 -18% 的 QLIKE 改善。

這篇文章不是一份里程碑摘要。它試圖將散落在數十個實驗中的零碎發現,編織成一個連貫的敘事,關於我們如何嘗試打破天花板、為什麼失敗、以及這對投資人意味著什麼。


一、什麼是 QLIKE 天花板?為什麼重要?

QLIKE 的定義

QLIKE(Quasi-Likelihood loss)是波動率預測領域的標準評估指標,由 Patton (2011) 系統化推導。其定義為:

\text{QLIKE} = \frac{σ2\sigma^2{\text{realized}}}{σ2\sigma^2{\text{forecast}}} - \log\left(\frac{σ2\sigma^2{\text{realized}}}{σ2\sigma^2{\text{forecast}}}\right) - 1

QLIKE 的核心優勢在於它對 volatility proxy 的選擇具有  robustness :不同 proxy(r², Parkinson RV, 5-min RV)會改變 QLIKE 的絕對值,但不會改變模型之間的排名。我們在 SPY 2023-2024 OOS 上驗證了這一點,無論用 r² (QLIKE=-8.378)、Parkinson (0.220)、或 corrected RV (0.680),GJR 始終排名第一。

天花板的意義

當我們說「QLIKE 天花板」時,我們指的是:

資產GJR QLIKE次佳模型差距
SPY-8.667GARCH (-8.651)-0.18%
GLD-8.430GARCH (-8.428)-0.02%
EEM-8.248GARCH (-8.230)-0.22%
TLT-8.144GARCH (-8.140)-0.05%
QQQ-7.966GARCH (-7.952)-0.18%

所有 5 個資產的 Ljung-Box 檢定 p > 0.30——殘差序列中沒有任何可預測的結構。GJR-GARCH 已經完全提取了日頻收益率中的波動率資訊。

這不是說 GJR-GARCH 是「完美」的預測器。它的 Mincer-Zarnowitz R² 僅有 0.004-0.047(相對於 5-min RV)。它只是在日頻資訊的約束下,已經是最優的。


二、四次獨立驗證

天花板假說的說服力不在於任何單一實驗,而在於多個獨立方向的收斂。

驗證 1:GARCH-MIDAS + INDPRO(工業生產指數)

 假說 :宏觀經濟資訊(月頻工業生產指數)可以補充日頻收益率的資訊不足。

GARCH-MIDAS(Engle, Ghysels & Sohn 2013)將波動率分解為短期 GARCH 組件和長期 MIDAS 組件: σt2=gt×τt\sigma^2_t = g_t \times \tau_t 其中 gtg_t 是標準 GJR-GARCH,τt\tau_t 由外部低頻變數(如 INDPRO)的 Beta 加權移動平均決定。

 結果 :In-sample 差異 < 0.02%,DM 不顯著 (p=0.36)。INDPRO 的 MIDAS 權重集中在 lag 1(45%),θ\theta 為負值(-0.005 至 -0.009),意味著工業生產下降→τ\tau 增加→波動率上升。這在理論上合理,衰退確實伴隨高波動,但效果太微小(< 0.1%),在大樣本中被雜訊淹沒。

驗證 2:GARCH-MIDAS + Credit Spread(BAAFFM)

 假說 :信用利差反映金融壓力,應能預測波動率。

 結果 :θ\theta ≈ 0,與 GJR QLIKE 差異 < 0.03%。DM 不顯著。

Baa-Aaa 信用利差是金融壓力的經典指標(Gilchrist & Zakrajsek 2012),但它的預測力已經被 GARCH 的 persistence 結構(α\alpha + β\beta + γ\gamma/2 ≈ 0.98)所內化。當波動率已經處於高位時,GARCH 的遞推自然會維持高預測值,不需要外部變數告訴它「金融條件正在收緊」。

驗證 3:GARCH-MIDAS + Yield Curve(T10Y2Y)

 假說 :殖利率曲線倒掛預示衰退和市場動盪。

 結果 :同樣 θ\theta ≈ 0,差異 < 0.03%。

殖利率曲線倒掛確實是衰退的領先指標(Estrella & Mishkin 1998),但它的預測 horizon 是 6-18 個月。對於日頻的 1-step-ahead 預測,這個時間尺度的資訊幾乎沒有增量價值。GARCH 的 persistence 已經是一個隱含的 regime detector——它不需要外部的衰退信號。

驗證 4:CARR + Yang-Zhang Range

 假說 :日內價格範圍(High-Low)包含比收盤價平方更多的波動率資訊。

這個驗證分兩步完成,後文詳述。關鍵結果:用 Yang-Zhang 修正 overnight bias 後,CARR 與 GJR 等效(+0.09%, DM NS)。Range 資訊和 squared return 資訊在 QLIKE 層面完全等價。

四次驗證的統一解讀

驗證外部資訊頻率QLIKE 改善DM p-value
GARCH-MIDAS (INDPRO)工業生產月頻< 0.02%NS
GARCH-MIDAS (BAAFFM)信用利差日頻< 0.03%NS
GARCH-MIDAS (T10Y2Y)殖利率曲線日頻< 0.03%NS
CARR (Yang-Zhang)日內價格範圍日頻+0.09%NS

四個方向,四種不同類型的外部資訊,結果完全一致:日頻 QLIKE 天花板無法突破。


三、四個自建模型的故事

本研究不只是跑現有套件。為了徹底測試天花板假說,我們從頭自建了四個模型,每個都是對天花板的不同方向攻擊。

模型 1:Realized GARCH(Hansen, Huang & Shek 2012)

 動機 :GARCH 只用收盤價收益率,Realized GARCH 加入 realized measure 作為測量方程。

 實作 :Log-linear specification,8 個參數,QML 估計 + multi-start。

 先導結果 (41 天 SPY 5-min RV):QLIKE 0.277 vs GJR 0.337(改善 -18%)。Corr(h, RV) = 0.267 vs GJR 0.090(3 倍提升)。

 限制 :41 天完全不夠做正式推論(β\beta=0.001, persistence=0.44——遠低於正常值 0.95+)。我們也測試了 hourly RV(730 天):QLIKE=-8.378 vs GJR -8.472(差 1.1%)——1 小時的 7 根 K 線精度不足。唯有 78 根/天的 5-min RV 才可能突破。

 狀態 :等待 5-min 數據累積至 252+ 天(預計 2027 Q1)。

模型 2:CAViaR(Engle & Manganelli 2004)

 動機 :直接建模 quantile(VaR),跳過分配假設。這是全新的方向,不走 GARCH→distribution→VaR 的傳統路線。

 實作 :4 種 specification(SAV, Asymmetric Slope, IG, Adaptive),月度重估 + 日度遞推。

 結果 :CAViaR-SAV 與 GJR-SkewT 統計等效(RQ 0.000402 vs 0.000421, DM p=0.35)。3/3 檢定通過(Kupiec + Christoffersen + DQ)。IG spec 退化失敗,Adaptive 有 clustering 問題。

 評價 :CAViaR 是可行的非參數替代方案,但不顯著優於 Skewed-t。對於 QLIKE 天花板的攻擊沒有幫助——CAViaR 不預測方差,而是直接預測分位數,所以它回答的是不同的問題。但它從側面確認:即使繞過分配假設,VaR 的品質仍然受限於底層波動率預測的精度。

模型 3:GARCH-MIDAS(Engle, Ghysels & Sohn 2013)

 動機 :混頻模型,讓低頻宏觀變數影響長期波動率水平。

 實作 :7 個參數(m, θ\theta, ω\omega₁, ω\omega₂ for MIDAS + α\alpha, β\beta, γ\gamma for GARCH),Beta 加權函數,profile QML 估計。

 結果 :已在上文第二節詳述。INDPRO/BAAFFM/T10Y2Y 三個 macro 變數均無顯著改善。

 一個值得深究的異常 :INDPRO variant 在 OOS 2023-2025 上 DM=-3.21, p=0.001——看似重大突破,但經仔細檢驗後降級為 period-specific anomaly(見第五節)。

模型 4:CARR(Chou 2005)

 動機 :Conditional Autoregressive Range model,用 log(High/Low) 替代 r² 作為波動率代理。理論上,range estimator 有 5-8 倍的統計效率。

 實作 :CARR(1,1),指數分配假設,MLE 估計。

 結果 :CARR 比 GJR 差 3.6%(DM p≈0),原因完全來自 Parkinson range 的 overnight bias(見第四節)。修正後等效。


四、為什麼 Parkinson Range 失敗,以及 Yang-Zhang 如何修正

Parkinson 的系統性偏誤

Parkinson (1980) 的 range-based volatility estimator 假設價格遵循連續的 geometric Brownian motion,從開盤到收盤。但現代市場有一個致命的結構性特徵: overnight gap 。

我們的數據顯示:

項目數值
SPY overnight variance 佔比44.3%(2020 COVID 達 62%)
Parkinson bias vs 5-min RV-33.9%
r² bias vs 5-min RV-24.9%
GARCH bias vs 5-min RV-1.2%

Parkinson RV 低估了近三分之一的真實波動率,因為它完全忽略了收盤到隔天開盤的價格變動。而 overnight variance 佔了接近一半的總方差!

更深層的問題:Parkinson 和 r² 與 5-min RV 的相關性只有 0.46——只解釋了 21% 的 RV 變異。這就是為什麼 Realized GARCH 用 Parkinson 作為 proxy 效果很差的根本原因。

Yang-Zhang 的修正

Yang-Zhang (2000) estimator 結合了 overnight return、open-to-close range、和 Rogers-Satchell estimator,完整覆蓋了 24 小時的價格變動。

當我們用 Yang-Zhang range 替代 Parkinson range 輸入 CARR 模型:

模型QLIKEvs GJRDM p
CARR (Parkinson)差 3.6%顯著劣於≈ 0
CARR (Yang-Zhang)+0.09%等效NS
GJR-GARCHbaseline——

差距從 3.6% 瞬間消失為 0.09%——完全可歸因於 overnight bias 的消除。

這告訴我們什麼?

Range 資訊(High-Low)在修正 overnight bias 後,與 squared return 資訊完全等價。日內極值沒有比收盤價更多的波動率資訊,至少在 1-step-ahead QLIKE 的意義上。

這並不是說 range 無用。Range estimator 確實有更高的統計效率(更低的方差),但在 GARCH 的遞推結構中,這個優勢被 persistence 項(β\beta ≈ 0.85)所吸收。昨天的 σ2\sigma^2 預測已經包含了所有歷史資訊;多出的 range precision 是錦上添花,而不是雪中送炭。


五、GARCH-MIDAS OOS p=0.001 的「虛假希望」

發現

在自建 GARCH-MIDAS 模型的 OOS 測試中,INDPRO variant 產生了一個令人興奮的結果:

  •  OOS 2023-2025 :DM = -3.21, p = 0.001, QLIKE 改善 -1.0%
  • 首個在 OOS 上顯著擊敗 GJR-GARCH 的模型!

自我質疑

但我們沒有止步於慶祝。五個質疑立刻浮現:

  1.  只有 SPY 一個資產 ——需要跨資產驗證
  2.  OOS 只有 802 天 (2023-2025),可能是特定 macro regime
  3.  INDPRO 有 ~2 個月發布滯後 ——是否有 look-ahead bias?
  4.  In-sample 不顯著(p=0.36)但 OOS 顯著(p=0.001) ——這種反轉需要解釋
  5.  RV variant in-sample 顯著但 OOS 不顯著 ——典型 overfitting 信號

降級為 period-specific anomaly

決定性的證據來自完整樣本內測試:

樣本INDPRO vs GJRDM p
2000-2019 (in-sample)< 0.02%NS
2000-2022 (in-sample)< 0.02%NS
2000-2025 (in-sample)< 0.02%NS
2023-2025 (OOS rolling)-1.0%0.001

三個不同範圍的完整樣本估計都顯示差異微乎其微。只有 2023-2025 的 rolling monthly re-estimation 產生了顯著改善。

 解讀 :2023-2025 恰好是一個特殊的宏觀環境——post-COVID recovery、Fed 升息後期、Hormuz 危機。INDPRO 在這個特定時期的下降趨勢與市場波動率上升恰好同步,產生了 conditional improvement。但這不是一個 universal relationship——它是 macro regime 特定的。

θ\theta 是負的(-0.005 到 -0.009),意味著 INDPRO 下降→τ\tau 增加→vol 增加。這在衰退時合理,但在經濟平穩期毫無預測力。GARCH 的 persistence 結構本身就是一個隱含的 regime detector——它不需要外部的衰退信號。

教訓

p = 0.001 並不等於「真實的改善」。Period-specific significant results 是金融計量學中最常見的陷阱之一。我們能夠識別這個陷阱,因為我們執行了完整樣本檢驗,而不是只報告最漂亮的 OOS 結果。


六、理論機制:r²_t 作為日頻方差的充分統計量

為什麼天花板存在?

天花板的理論基礎可以用一個簡潔的命題陳述:

 命題(Daily QLIKE Ceiling) :在只能觀測日頻 close-to-close return r_t 的條件下,r²_t 是日頻 conditional variance σ2\sigma^2t 的 充分統計量 。GJR-GARCH(1,1) 的遞推結構 σ2\sigma^2{t+1} = f(σ2\sigma^2_t, r²_t, I(r_t<0)) 已經完全利用了這個充分統計量。

 推論 :任何額外的日頻或低頻資訊 X_t 只有在它包含 r²_t 未涵蓋的資訊時才有價值。但我們的四次驗證表明——INDPRO、credit spread、yield curve、daily range(修正後),都不包含這樣的增量資訊。

直覺解釋

想像一下日頻收益率 r_t 是對日內所有交易活動的「壓縮摘要」。r²_t 保留了這個摘要中關於波動率的所有資訊。GARCH 的 persistence 項 \beta$$\sigma^2_t 則保留了所有歷史摘要的累積記憶。

要突破天花板,你需要的不是「更聰明的壓縮方式」,而是「更豐富的原始數據」,也就是日內高頻數據。

不同模型為何殊途同歸

模型策略為何失敗
GARCH-MIDAS加入低頻 macro日頻 r² 已內含 macro impact
CARR用 range 替代 r²Range(修正後)≈ r² 的等價表達
FIGARCH用長記憶替代 GARCHd=0.683 存在但不改善 1-step(+8.7% 更差)
GARCH-X (VIX)加入 implied volVIX 係數不穩定(std=0.821),增量太弱(4.5%)
LSTM/GRU非線性捕捉日頻殘差已 iid,無非線性結構可學
XGBoost Stacking模型組合係數趨近常數(~1e-4),無互補資訊
GRU (5500 天)更多數據的 DL改善 0.06%——統計不顯著

每一個模型本質上都在試圖從同一個充分統計量 r²_t 中榨取更多,結果自然是殊途同歸。


七、唯一的希望:5-min Realized GARCH

為什麼高頻數據能突破?

5-min RV 攜帶了 r²_t 所不具備的資訊,日內波動率的時間結構。一天之內,波動率可能在開盤時集中、午間平靜、收盤前再次上升。這些 pattern 在日頻收益率中被壓縮為一個數字,但在 5-min RV 中被完整保留。

更具體地說:

度量效率比 r²覆蓋
r²(1 觀測/天)1xClose-to-close
Parkinson(1 觀測/天)5xIntraday High-Low(漏 overnight)
5-min RV(78 觀測/天)78x交易時段(需加 overnight)

5-min RV 不只是更精確的估計器,它攜帶了全新的資訊維度。

先導結果的前景與限制

指標Realized GARCHGJR-GARCH改善
QLIKE (41 天)0.2770.337-18%
Corr(h, RV)0.2670.0903x
Persistence0.440.98—
β\beta0.0010.85—

-18% 的改善如果在正式測試中成立,將是本研究最重要的發現。但 41 天的數據遠不足以得出結論——persistence 只有 0.44(正常值 0.95+),β\beta 基本為零,都是小樣本的症狀。

我們也測試了 hourly RV 替代方案(730 天可用):差 1.1%——7 根 K 線/天的精度不足以超越 GJR。必須等到 78 根/天的 5-min 數據。

時間表

  •  目前 :41 天 5-min RV(yfinance 限制 60 天滾動窗口)
  •  2027 Q1 :累積約 252 天,足夠做 preliminary OOS
  •  2028 初 :累積 ~756 天(504 IS + 252 OOS),完整正式測試
  •  持續收集中 :每日自動化腳本已部署

八、實務意義:投資人不需要複雜模型

對一般投資人的啟示

天花板的存在是一個 好消息 :

  1.  你不需要 GARCH-MIDAS :宏觀變數對日頻預測沒有增量價值
  2.  你不需要 CARR :Range-based model 修正 bias 後與 GARCH 等效
  3.  你不需要 FIGARCH :長記憶存在但不改善 1-step 預測
  4.  你不需要 LSTM/GRU :日頻殘差已是 iid,深度學習無用武之地
  5.  你不需要 ensemble :模型堆疊的係數趨近常數

 你只需要 GJR-GARCH(1,1) ,加上以下設定:

參數建議值理由
Window2000(權益/商品), 504(債券)VaR 更穩定,persistence bias ≈ 0
分配Student-t, df=5 固定比 estimated df 更穩健
模型選擇γ\gamma t-stat > 1.65 → GJR, 否則 GARCH100% 準確率(12 DM tests)

更進一步的簡化

甚至連 GARCH 都可能不需要。在 VT(Volatility Targeting)策略的框架下:

  •  12/VIX + SHY :Sharpe 0.68, MaxDD -27%(零 GARCH 計算)
  •  VIX Step Rule (VIX<15→100%, 15-25→70%, >25→48%):Sharpe 0.69(連 12/VIX 的除法都省了)

VIX 包含 variance risk premium——前瞻性的恐慌定價,這是 GARCH(基於歷史收益率的 physical measure)不具備的。12/VIX 在 7 個 OOS 期間中有 5 個擊敗 GARCH VT。


九、與 Phase O VaR 發現的連結

分配不影響 QLIKE

Phase O12 的實驗提供了一個重要的正交性結果:

分配QLIKE vs GJR-NormalDM p
Normalbaseline—
Student-t (df=5)+0.054%NS
Skewed-t+0.057%0.56

三種分配的 GARCH 參數(ω\omega, α\alpha, β\beta, γ\gamma)幾乎相同。 分配假設只影響 VaR 尾部,不影響 σ2\sigma^2 中心預測 。

這確立了一個三維正交框架:

維度決定最佳選擇
GARCH 方程QLIKE(中心預測)GJR-GARCH(1,1)
分配假設VaR/ES(尾部風險)Skewed-t (6/6 Kupiec)
策略信號投資決策12/VIX(含 VRP)

三個維度互不影響,可以獨立優化。這是整個研究體系中最乾淨的結構性結論之一。


十、未來方向:等待 5-min 數據

已確認的方向

方向預期時間表障礙
5-min Realized GARCHQLIKE -18%(先導)2027 Q1(preliminary)數據累積
HAR-RV高頻 realized vol 直接模型同上同上
MF2-GARCH(Conrad 2025)用預測誤差 pattern可立即測試需自建

已排除的方向

方向排除理由
任何日頻 GARCH 變體天花板已被四重驗證
日頻 deep learning殘差 iid,無結構可學
Macro timing(日頻)GARCH persistence 已內含
Range-based model修正後等效
Model stacking/ensemble係數趨近常數

自我質疑與限制

  1.  四次驗證足夠嗎?  我們只測試了一類 macro 變數(經濟指標)和一類 range 變數。還有 sentiment、options market、order flow 等方向未測試。但 GARCH 殘差的 Ljung-Box 結果(p > 0.30)從統計上排除了任何遺漏的日頻結構。

  2.  SPY 的結果能推廣嗎?  QLIKE 天花板在 5 個資產上成立(SPY/QQQ/GLD/TLT/EEM),但 GARCH-MIDAS 的 period-specific 結果只在 SPY 上測試。跨資產驗證仍是待辦事項。

  3.  Realized GARCH 的 -18% 是否可靠?  41 天的先導測試幾乎沒有統計效力。但 Hansen et al. (2012) 在 DJIA 上的完整測試顯示了「substantial improvements」,文獻支持方向性結論。

  4.  如果 5-min 數據也無法突破呢?  那麼天花板可能不是日頻的問題,而是 GARCH 遞推結構本身的最優性。但這與文獻中 HAR-RV 優於 GARCH 的證據矛盾,更可能的解釋是我們需要更長的高頻數據。


結語

本研究最重要的發現可能不是任何單一實驗的結果,而是一個 meta-conclusion:

 在日頻資訊的約束下,波動率預測的邊際改善幾乎為零。GJR-GARCH(1,1) 不是因為它有多好,而是因為日頻收益率中的波動率資訊就那麼多。 

這個結論解放了研究者和投資人。你不需要追逐最新的 GARCH 變體、不需要擔心遺漏了什麼宏觀變數、不需要花力氣做 model ensemble。GJR-GARCH 已經是最佳答案。

唯一能改變這個結論的,是更高頻率的數據。我們已經建好了 Realized GARCH 的基礎設施,正在累積 5-min 數據。大約一年後,我們就能知道天花板是否真的能被打破。

在那之前—— 簡單即最優 。


實驗數量:50+ 自建模型:4 個(Realized GARCH, CAViaR, GARCH-MIDAS, CARR) 獨立驗證:4 次 跨越資產:5 個(SPY, QQQ, GLD, TLT, EEM) 研究時間:2026-03-14 至 2026-03-17(Phase A 至 Phase P)

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
K1378:VIX 長期成分讓 SPY 波動預測勝過 GJR-GARCH,這個優勢在疫情窗外更穩定
做風險控管或選擇權定價的人,常要在兩種日頻波動模型之間取捨:只用報酬本身的 GJR-GARCH,或在 GARCH 之外加一個由 VIX 驅動的長期成分。後者多了一個外部變數要維護,值不值得,要看它的預測優勢從哪裡來。如果優勢只來自 2020 年那種市場崩跌的少數日子,平常用它就只是多背一個依賴;如果優勢出現在一般日子,它才是日常可用的改進。 K1378 用 SPY 的樣本外一步預測回答這個問題:A…
→
📄
K1876:GVZ 預警黃金回撤的 regime 交互假說被推翻,而且這份樣本的 R=1 月份幾乎只出現在 2013–2016
一般讀者版(〈持有黃金,20 天內從高點回落 5% 的機率約四分之一〉)講的是結論:GVZ 做成的事前預警,樣本外勝不過歷史發生率。這篇補上那篇沒談的三件事:事前登記的 regime 交互假說為什麼被推翻、Clark-West 為正而 Brier 變差要怎麼讀、以及這份樣本裡的 regime 為什麼幾乎等於一個年代虛擬變數。 設定 事件:起點 t 之後 20 個交易日內,GLD 收盤價自期間高點回…
→
📄
VIX 越高、衝擊越被「吸收」?比例式衝擊倍數的分母陷阱與門檻效應
VIX 已經很高時,再來一次 VIX 大跳,SPY 的反應會不會變小?常見的量法是「衝擊倍數」(shock amplification ratio,SAR):衝擊日的 |r| 除以平日的 |r|。這個倍數確實隨前一日 VIX 升高而下降,於是很容易讀成「高波動環境會吸收衝擊」。本文檢驗這個讀法在三個地方站不站得住:分母、門檻,以及外生衝擊。 資料是 SPY 與 VIX 日資料,2006-01-05…
→