日頻 QLIKE 天花板:四次獨立驗證、四個自建模型、與唯一的突破希望
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
[提出: Claude+Gemini+Codex, 執行: Claude]
日頻 QLIKE 天花板:四次獨立驗證、四個自建模型、與唯一的突破希望
摘要
經過 50+ 個實驗、4 個自建模型、4 次獨立驗證,我們得出一個令人既沮喪又解放的結論: GJR-GARCH(1,1) 定義了日頻波動率預測的 QLIKE 下界 。任何僅使用日頻或更低頻率資訊的模型,無論多麼精巧,都無法顯著突破這個天花板。唯一的例外是使用 5 分鐘高頻數據的 Realized GARCH,它在 41 天先導測試中展現了 -18% 的 QLIKE 改善。
這篇文章不是一份里程碑摘要。它試圖將散落在數十個實驗中的零碎發現,編織成一個連貫的敘事,關於我們如何嘗試打破天花板、為什麼失敗、以及這對投資人意味著什麼。
一、什麼是 QLIKE 天花板?為什麼重要?
QLIKE 的定義
QLIKE(Quasi-Likelihood loss)是波動率預測領域的標準評估指標,由 Patton (2011) 系統化推導。其定義為:
\text{QLIKE} = \frac{{\text{realized}}}{{\text{forecast}}} - \log\left(\frac{{\text{realized}}}{{\text{forecast}}}\right) - 1
QLIKE 的核心優勢在於它對 volatility proxy 的選擇具有 robustness :不同 proxy(r², Parkinson RV, 5-min RV)會改變 QLIKE 的絕對值,但不會改變模型之間的排名。我們在 SPY 2023-2024 OOS 上驗證了這一點,無論用 r² (QLIKE=-8.378)、Parkinson (0.220)、或 corrected RV (0.680),GJR 始終排名第一。
天花板的意義
當我們說「QLIKE 天花板」時,我們指的是:
| 資產 | GJR QLIKE | 次佳模型 | 差距 |
|---|---|---|---|
| SPY | -8.667 | GARCH (-8.651) | -0.18% |
| GLD | -8.430 | GARCH (-8.428) | -0.02% |
| EEM | -8.248 | GARCH (-8.230) | -0.22% |
| TLT | -8.144 | GARCH (-8.140) | -0.05% |
| QQQ | -7.966 | GARCH (-7.952) | -0.18% |
所有 5 個資產的 Ljung-Box 檢定 p > 0.30——殘差序列中沒有任何可預測的結構。GJR-GARCH 已經完全提取了日頻收益率中的波動率資訊。
這不是說 GJR-GARCH 是「完美」的預測器。它的 Mincer-Zarnowitz R² 僅有 0.004-0.047(相對於 5-min RV)。它只是在日頻資訊的約束下,已經是最優的。
二、四次獨立驗證
天花板假說的說服力不在於任何單一實驗,而在於多個獨立方向的收斂。
驗證 1:GARCH-MIDAS + INDPRO(工業生產指數)
假說 :宏觀經濟資訊(月頻工業生產指數)可以補充日頻收益率的資訊不足。
GARCH-MIDAS(Engle, Ghysels & Sohn 2013)將波動率分解為短期 GARCH 組件和長期 MIDAS 組件: 其中 是標準 GJR-GARCH, 由外部低頻變數(如 INDPRO)的 Beta 加權移動平均決定。
結果 :In-sample 差異 < 0.02%,DM 不顯著 (p=0.36)。INDPRO 的 MIDAS 權重集中在 lag 1(45%), 為負值(-0.005 至 -0.009),意味著工業生產下降→ 增加→波動率上升。這在理論上合理,衰退確實伴隨高波動,但效果太微小(< 0.1%),在大樣本中被雜訊淹沒。
驗證 2:GARCH-MIDAS + Credit Spread(BAAFFM)
假說 :信用利差反映金融壓力,應能預測波動率。
結果 : ≈ 0,與 GJR QLIKE 差異 < 0.03%。DM 不顯著。
Baa-Aaa 信用利差是金融壓力的經典指標(Gilchrist & Zakrajsek 2012),但它的預測力已經被 GARCH 的 persistence 結構( + + /2 ≈ 0.98)所內化。當波動率已經處於高位時,GARCH 的遞推自然會維持高預測值,不需要外部變數告訴它「金融條件正在收緊」。
驗證 3:GARCH-MIDAS + Yield Curve(T10Y2Y)
假說 :殖利率曲線倒掛預示衰退和市場動盪。
結果 :同樣 ≈ 0,差異 < 0.03%。
殖利率曲線倒掛確實是衰退的領先指標(Estrella & Mishkin 1998),但它的預測 horizon 是 6-18 個月。對於日頻的 1-step-ahead 預測,這個時間尺度的資訊幾乎沒有增量價值。GARCH 的 persistence 已經是一個隱含的 regime detector——它不需要外部的衰退信號。
驗證 4:CARR + Yang-Zhang Range
假說 :日內價格範圍(High-Low)包含比收盤價平方更多的波動率資訊。
這個驗證分兩步完成,後文詳述。關鍵結果:用 Yang-Zhang 修正 overnight bias 後,CARR 與 GJR 等效(+0.09%, DM NS)。Range 資訊和 squared return 資訊在 QLIKE 層面完全等價。
四次驗證的統一解讀
| 驗證 | 外部資訊 | 頻率 | QLIKE 改善 | DM p-value |
|---|---|---|---|---|
| GARCH-MIDAS (INDPRO) | 工業生產 | 月頻 | < 0.02% | NS |
| GARCH-MIDAS (BAAFFM) | 信用利差 | 日頻 | < 0.03% | NS |
| GARCH-MIDAS (T10Y2Y) | 殖利率曲線 | 日頻 | < 0.03% | NS |
| CARR (Yang-Zhang) | 日內價格範圍 | 日頻 | +0.09% | NS |
四個方向,四種不同類型的外部資訊,結果完全一致:日頻 QLIKE 天花板無法突破。
三、四個自建模型的故事
本研究不只是跑現有套件。為了徹底測試天花板假說,我們從頭自建了四個模型,每個都是對天花板的不同方向攻擊。
模型 1:Realized GARCH(Hansen, Huang & Shek 2012)
動機 :GARCH 只用收盤價收益率,Realized GARCH 加入 realized measure 作為測量方程。
實作 :Log-linear specification,8 個參數,QML 估計 + multi-start。
先導結果 (41 天 SPY 5-min RV):QLIKE 0.277 vs GJR 0.337(改善 -18%)。Corr(h, RV) = 0.267 vs GJR 0.090(3 倍提升)。
限制 :41 天完全不夠做正式推論(=0.001, persistence=0.44——遠低於正常值 0.95+)。我們也測試了 hourly RV(730 天):QLIKE=-8.378 vs GJR -8.472(差 1.1%)——1 小時的 7 根 K 線精度不足。唯有 78 根/天的 5-min RV 才可能突破。
狀態 :等待 5-min 數據累積至 252+ 天(預計 2027 Q1)。
模型 2:CAViaR(Engle & Manganelli 2004)
動機 :直接建模 quantile(VaR),跳過分配假設。這是全新的方向,不走 GARCH→distribution→VaR 的傳統路線。
實作 :4 種 specification(SAV, Asymmetric Slope, IG, Adaptive),月度重估 + 日度遞推。
結果 :CAViaR-SAV 與 GJR-SkewT 統計等效(RQ 0.000402 vs 0.000421, DM p=0.35)。3/3 檢定通過(Kupiec + Christoffersen + DQ)。IG spec 退化失敗,Adaptive 有 clustering 問題。
評價 :CAViaR 是可行的非參數替代方案,但不顯著優於 Skewed-t。對於 QLIKE 天花板的攻擊沒有幫助——CAViaR 不預測方差,而是直接預測分位數,所以它回答的是不同的問題。但它從側面確認:即使繞過分配假設,VaR 的品質仍然受限於底層波動率預測的精度。
模型 3:GARCH-MIDAS(Engle, Ghysels & Sohn 2013)
動機 :混頻模型,讓低頻宏觀變數影響長期波動率水平。
實作 :7 個參數(m, , ₁, ₂ for MIDAS + , , for GARCH),Beta 加權函數,profile QML 估計。
結果 :已在上文第二節詳述。INDPRO/BAAFFM/T10Y2Y 三個 macro 變數均無顯著改善。
一個值得深究的異常 :INDPRO variant 在 OOS 2023-2025 上 DM=-3.21, p=0.001——看似重大突破,但經仔細檢驗後降級為 period-specific anomaly(見第五節)。
模型 4:CARR(Chou 2005)
動機 :Conditional Autoregressive Range model,用 log(High/Low) 替代 r² 作為波動率代理。理論上,range estimator 有 5-8 倍的統計效率。
實作 :CARR(1,1),指數分配假設,MLE 估計。
結果 :CARR 比 GJR 差 3.6%(DM p≈0),原因完全來自 Parkinson range 的 overnight bias(見第四節)。修正後等效。
四、為什麼 Parkinson Range 失敗,以及 Yang-Zhang 如何修正
Parkinson 的系統性偏誤
Parkinson (1980) 的 range-based volatility estimator 假設價格遵循連續的 geometric Brownian motion,從開盤到收盤。但現代市場有一個致命的結構性特徵: overnight gap 。
我們的數據顯示:
| 項目 | 數值 |
|---|---|
| SPY overnight variance 佔比 | 44.3%(2020 COVID 達 62%) |
| Parkinson bias vs 5-min RV | -33.9% |
| r² bias vs 5-min RV | -24.9% |
| GARCH bias vs 5-min RV | -1.2% |
Parkinson RV 低估了近三分之一的真實波動率,因為它完全忽略了收盤到隔天開盤的價格變動。而 overnight variance 佔了接近一半的總方差!
更深層的問題:Parkinson 和 r² 與 5-min RV 的相關性只有 0.46——只解釋了 21% 的 RV 變異。這就是為什麼 Realized GARCH 用 Parkinson 作為 proxy 效果很差的根本原因。
Yang-Zhang 的修正
Yang-Zhang (2000) estimator 結合了 overnight return、open-to-close range、和 Rogers-Satchell estimator,完整覆蓋了 24 小時的價格變動。
當我們用 Yang-Zhang range 替代 Parkinson range 輸入 CARR 模型:
| 模型 | QLIKE | vs GJR | DM p |
|---|---|---|---|
| CARR (Parkinson) | 差 3.6% | 顯著劣於 | ≈ 0 |
| CARR (Yang-Zhang) | +0.09% | 等效 | NS |
| GJR-GARCH | baseline | — | — |
差距從 3.6% 瞬間消失為 0.09%——完全可歸因於 overnight bias 的消除。
這告訴我們什麼?
Range 資訊(High-Low)在修正 overnight bias 後,與 squared return 資訊完全等價。日內極值沒有比收盤價更多的波動率資訊,至少在 1-step-ahead QLIKE 的意義上。
這並不是說 range 無用。Range estimator 確實有更高的統計效率(更低的方差),但在 GARCH 的遞推結構中,這個優勢被 persistence 項( ≈ 0.85)所吸收。昨天的 預測已經包含了所有歷史資訊;多出的 range precision 是錦上添花,而不是雪中送炭。
五、GARCH-MIDAS OOS p=0.001 的「虛假希望」
發現
在自建 GARCH-MIDAS 模型的 OOS 測試中,INDPRO variant 產生了一個令人興奮的結果:
- OOS 2023-2025 :DM = -3.21, p = 0.001, QLIKE 改善 -1.0%
- 首個在 OOS 上顯著擊敗 GJR-GARCH 的模型!
自我質疑
但我們沒有止步於慶祝。五個質疑立刻浮現:
- 只有 SPY 一個資產 ——需要跨資產驗證
- OOS 只有 802 天 (2023-2025),可能是特定 macro regime
- INDPRO 有 ~2 個月發布滯後 ——是否有 look-ahead bias?
- In-sample 不顯著(p=0.36)但 OOS 顯著(p=0.001) ——這種反轉需要解釋
- RV variant in-sample 顯著但 OOS 不顯著 ——典型 overfitting 信號
降級為 period-specific anomaly
決定性的證據來自完整樣本內測試:
| 樣本 | INDPRO vs GJR | DM p |
|---|---|---|
| 2000-2019 (in-sample) | < 0.02% | NS |
| 2000-2022 (in-sample) | < 0.02% | NS |
| 2000-2025 (in-sample) | < 0.02% | NS |
| 2023-2025 (OOS rolling) | -1.0% | 0.001 |
三個不同範圍的完整樣本估計都顯示差異微乎其微。只有 2023-2025 的 rolling monthly re-estimation 產生了顯著改善。
解讀 :2023-2025 恰好是一個特殊的宏觀環境——post-COVID recovery、Fed 升息後期、Hormuz 危機。INDPRO 在這個特定時期的下降趨勢與市場波動率上升恰好同步,產生了 conditional improvement。但這不是一個 universal relationship——它是 macro regime 特定的。
是負的(-0.005 到 -0.009),意味著 INDPRO 下降→ 增加→vol 增加。這在衰退時合理,但在經濟平穩期毫無預測力。GARCH 的 persistence 結構本身就是一個隱含的 regime detector——它不需要外部的衰退信號。
教訓
p = 0.001 並不等於「真實的改善」。Period-specific significant results 是金融計量學中最常見的陷阱之一。我們能夠識別這個陷阱,因為我們執行了完整樣本檢驗,而不是只報告最漂亮的 OOS 結果。
六、理論機制:r²_t 作為日頻方差的充分統計量
為什麼天花板存在?
天花板的理論基礎可以用一個簡潔的命題陳述:
命題(Daily QLIKE Ceiling) :在只能觀測日頻 close-to-close return r_t 的條件下,r²_t 是日頻 conditional variance t 的 充分統計量 。GJR-GARCH(1,1) 的遞推結構 {t+1} = f(_t, r²_t, I(r_t<0)) 已經完全利用了這個充分統計量。
推論 :任何額外的日頻或低頻資訊 X_t 只有在它包含 r²_t 未涵蓋的資訊時才有價值。但我們的四次驗證表明——INDPRO、credit spread、yield curve、daily range(修正後),都不包含這樣的增量資訊。
直覺解釋
想像一下日頻收益率 r_t 是對日內所有交易活動的「壓縮摘要」。r²_t 保留了這個摘要中關於波動率的所有資訊。GARCH 的 persistence 項 \beta$$\sigma^2_t 則保留了所有歷史摘要的累積記憶。
要突破天花板,你需要的不是「更聰明的壓縮方式」,而是「更豐富的原始數據」,也就是日內高頻數據。
不同模型為何殊途同歸
| 模型 | 策略 | 為何失敗 |
|---|---|---|
| GARCH-MIDAS | 加入低頻 macro | 日頻 r² 已內含 macro impact |
| CARR | 用 range 替代 r² | Range(修正後)≈ r² 的等價表達 |
| FIGARCH | 用長記憶替代 GARCH | d=0.683 存在但不改善 1-step(+8.7% 更差) |
| GARCH-X (VIX) | 加入 implied vol | VIX 係數不穩定(std=0.821),增量太弱(4.5%) |
| LSTM/GRU | 非線性捕捉 | 日頻殘差已 iid,無非線性結構可學 |
| XGBoost Stacking | 模型組合 | 係數趨近常數(~1e-4),無互補資訊 |
| GRU (5500 天) | 更多數據的 DL | 改善 0.06%——統計不顯著 |
每一個模型本質上都在試圖從同一個充分統計量 r²_t 中榨取更多,結果自然是殊途同歸。
七、唯一的希望:5-min Realized GARCH
為什麼高頻數據能突破?
5-min RV 攜帶了 r²_t 所不具備的資訊,日內波動率的時間結構。一天之內,波動率可能在開盤時集中、午間平靜、收盤前再次上升。這些 pattern 在日頻收益率中被壓縮為一個數字,但在 5-min RV 中被完整保留。
更具體地說:
| 度量 | 效率比 r² | 覆蓋 |
|---|---|---|
| r²(1 觀測/天) | 1x | Close-to-close |
| Parkinson(1 觀測/天) | 5x | Intraday High-Low(漏 overnight) |
| 5-min RV(78 觀測/天) | 78x | 交易時段(需加 overnight) |
5-min RV 不只是更精確的估計器,它攜帶了全新的資訊維度。
先導結果的前景與限制
| 指標 | Realized GARCH | GJR-GARCH | 改善 |
|---|---|---|---|
| QLIKE (41 天) | 0.277 | 0.337 | -18% |
| Corr(h, RV) | 0.267 | 0.090 | 3x |
| Persistence | 0.44 | 0.98 | — |
| 0.001 | 0.85 | — |
-18% 的改善如果在正式測試中成立,將是本研究最重要的發現。但 41 天的數據遠不足以得出結論——persistence 只有 0.44(正常值 0.95+), 基本為零,都是小樣本的症狀。
我們也測試了 hourly RV 替代方案(730 天可用):差 1.1%——7 根 K 線/天的精度不足以超越 GJR。必須等到 78 根/天的 5-min 數據。
時間表
- 目前 :41 天 5-min RV(yfinance 限制 60 天滾動窗口)
- 2027 Q1 :累積約 252 天,足夠做 preliminary OOS
- 2028 初 :累積 ~756 天(504 IS + 252 OOS),完整正式測試
- 持續收集中 :每日自動化腳本已部署
八、實務意義:投資人不需要複雜模型
對一般投資人的啟示
天花板的存在是一個 好消息 :
- 你不需要 GARCH-MIDAS :宏觀變數對日頻預測沒有增量價值
- 你不需要 CARR :Range-based model 修正 bias 後與 GARCH 等效
- 你不需要 FIGARCH :長記憶存在但不改善 1-step 預測
- 你不需要 LSTM/GRU :日頻殘差已是 iid,深度學習無用武之地
- 你不需要 ensemble :模型堆疊的係數趨近常數
你只需要 GJR-GARCH(1,1) ,加上以下設定:
| 參數 | 建議值 | 理由 |
|---|---|---|
| Window | 2000(權益/商品), 504(債券) | VaR 更穩定,persistence bias ≈ 0 |
| 分配 | Student-t, df=5 固定 | 比 estimated df 更穩健 |
| 模型選擇 | t-stat > 1.65 → GJR, 否則 GARCH | 100% 準確率(12 DM tests) |
更進一步的簡化
甚至連 GARCH 都可能不需要。在 VT(Volatility Targeting)策略的框架下:
- 12/VIX + SHY :Sharpe 0.68, MaxDD -27%(零 GARCH 計算)
- VIX Step Rule (VIX<15→100%, 15-25→70%, >25→48%):Sharpe 0.69(連 12/VIX 的除法都省了)
VIX 包含 variance risk premium——前瞻性的恐慌定價,這是 GARCH(基於歷史收益率的 physical measure)不具備的。12/VIX 在 7 個 OOS 期間中有 5 個擊敗 GARCH VT。
九、與 Phase O VaR 發現的連結
分配不影響 QLIKE
Phase O12 的實驗提供了一個重要的正交性結果:
| 分配 | QLIKE vs GJR-Normal | DM p |
|---|---|---|
| Normal | baseline | — |
| Student-t (df=5) | +0.054% | NS |
| Skewed-t | +0.057% | 0.56 |
三種分配的 GARCH 參數(, , , )幾乎相同。 分配假設只影響 VaR 尾部,不影響 中心預測 。
這確立了一個三維正交框架:
| 維度 | 決定 | 最佳選擇 |
|---|---|---|
| GARCH 方程 | QLIKE(中心預測) | GJR-GARCH(1,1) |
| 分配假設 | VaR/ES(尾部風險) | Skewed-t (6/6 Kupiec) |
| 策略信號 | 投資決策 | 12/VIX(含 VRP) |
三個維度互不影響,可以獨立優化。這是整個研究體系中最乾淨的結構性結論之一。
十、未來方向:等待 5-min 數據
已確認的方向
| 方向 | 預期 | 時間表 | 障礙 |
|---|---|---|---|
| 5-min Realized GARCH | QLIKE -18%(先導) | 2027 Q1(preliminary) | 數據累積 |
| HAR-RV | 高頻 realized vol 直接模型 | 同上 | 同上 |
| MF2-GARCH(Conrad 2025) | 用預測誤差 pattern | 可立即測試 | 需自建 |
已排除的方向
| 方向 | 排除理由 |
|---|---|
| 任何日頻 GARCH 變體 | 天花板已被四重驗證 |
| 日頻 deep learning | 殘差 iid,無結構可學 |
| Macro timing(日頻) | GARCH persistence 已內含 |
| Range-based model | 修正後等效 |
| Model stacking/ensemble | 係數趨近常數 |
自我質疑與限制
-
四次驗證足夠嗎? 我們只測試了一類 macro 變數(經濟指標)和一類 range 變數。還有 sentiment、options market、order flow 等方向未測試。但 GARCH 殘差的 Ljung-Box 結果(p > 0.30)從統計上排除了任何遺漏的日頻結構。
-
SPY 的結果能推廣嗎? QLIKE 天花板在 5 個資產上成立(SPY/QQQ/GLD/TLT/EEM),但 GARCH-MIDAS 的 period-specific 結果只在 SPY 上測試。跨資產驗證仍是待辦事項。
-
Realized GARCH 的 -18% 是否可靠? 41 天的先導測試幾乎沒有統計效力。但 Hansen et al. (2012) 在 DJIA 上的完整測試顯示了「substantial improvements」,文獻支持方向性結論。
-
如果 5-min 數據也無法突破呢? 那麼天花板可能不是日頻的問題,而是 GARCH 遞推結構本身的最優性。但這與文獻中 HAR-RV 優於 GARCH 的證據矛盾,更可能的解釋是我們需要更長的高頻數據。
結語
本研究最重要的發現可能不是任何單一實驗的結果,而是一個 meta-conclusion:
在日頻資訊的約束下,波動率預測的邊際改善幾乎為零。GJR-GARCH(1,1) 不是因為它有多好,而是因為日頻收益率中的波動率資訊就那麼多。
這個結論解放了研究者和投資人。你不需要追逐最新的 GARCH 變體、不需要擔心遺漏了什麼宏觀變數、不需要花力氣做 model ensemble。GJR-GARCH 已經是最佳答案。
唯一能改變這個結論的,是更高頻率的數據。我們已經建好了 Realized GARCH 的基礎設施,正在累積 5-min 數據。大約一年後,我們就能知道天花板是否真的能被打破。
在那之前—— 簡單即最優 。
實驗數量:50+ 自建模型:4 個(Realized GARCH, CAViaR, GARCH-MIDAS, CARR) 獨立驗證:4 次 跨越資產:5 個(SPY, QQQ, GLD, TLT, EEM) 研究時間:2026-03-14 至 2026-03-17(Phase A 至 Phase P)
相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊