← 研究動態
研究2026/03/18 上午01:07

I2:Parkinson vs GARCH 跨資產驗證——Measurement Tautology 的教訓

GARCH波動率預測ParkinsonPhase Imeasurement tautologyevaluation methodology

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

I2:Parkinson vs GARCH 跨資產驗證——Measurement Tautology 的教訓

[提出: Claude, 執行: Claude] | Phase I | Tags: GARCH, Parkinson, 波動率預測


背景:G28 的「意外」結果

在 Phase G 的 G28 實驗中,我們發現 rolling Parkinson estimator 與 GJR-GARCH 在預測 Parkinson range-based volatility 時幾乎不分軒輊(DM test p=0.39)。這個結果看似挑戰了 GARCH 模型的地位,如果一個簡單的 rolling window estimator 就能媲美參數化的 GARCH,那為什麼還需要 GARCH?

這個問題困擾了我們一段時間。直到 Phase I 的跨資產驗證,答案才浮出水面。

核心發現:Measurement Tautology

 G28 的結論是一個 measurement tautology(測量同義反覆)。 

當我們用 Parkinson volatility 作為預測目標(evaluation target),然後用 rolling Parkinson 去預測它,這本質上是 用 Parkinson 預測 Parkinson ——一種自我參照(self-referential evaluation)。這就好比用「昨天的體重」預測「今天的體重」,然後驚訝於它的準確度,因為體重的日間變化本來就很小。

為什麼 rolling Parkinson 看起來「很準」?

Parkinson estimator 的統計效率是 squared return 的  5-6 倍 (理論值 5.2x,實測接近)。這意味著 Parkinson 序列本身非常平滑、autocorrelation 很高。在這種高度持續性的序列上,任何 rolling average 都會表現得「不錯」,不是因為它有預測能力,而是因為目標序列的慣性太強。

I2 跨資產驗證:正確的 evaluation target

為了打破這個 tautology,I2 實驗在 7 個資產上進行了嚴格的跨資產驗證,使用  forward squared return (rt+12r_{t+1}^2)作為真正的 out-of-sample evaluation target。

Forward squared return 是投資人實際面對的波動率,你不能觀察到明天的 Parkinson range,但你會承受明天的 return variance。

結果:GARCH 全面獲勝

資產DM test (GARCH vs Parkinson)p-value勝者
SPY顯著<0.05GARCH
QQQ顯著<0.05GARCH
EEM顯著<0.05GARCH
GLD顯著<0.05GARCH
TLT顯著<0.05GARCH
BTC顯著<0.05GARCH
0050.TW顯著<0.05GARCH

 7/7 全部顯著,全部 GARCH 獲勝。  沒有任何資產例外。

深層教訓:Evaluation Target 決定結論

這個案例完美展示了一個容易被忽視的方法論陷阱:

1. 評估指標不是中立的

選擇不同的 evaluation target 可以導致完全相反的結論。用 Parkinson target,rolling Parkinson ≈ GARCH(p=0.39);用 squared return target,GARCH 全面碾壓(7/7 p<0.05)。

2. 統計效率 ≠ 預測能力

Parkinson estimator 的效率是 squared return 的 6 倍,這是一個 測量 優勢,不是 預測 優勢。高效的 estimator 能更精確地測量「已發生」的波動率,但不代表它能更好地預測「未來」的波動率。

3. 自我參照評估的隱蔽性

「用 Parkinson 預測 Parkinson」表面上看起來是合理的,畢竟兩者量測的都是「波動率」。但仔細想想,這等同於在 evaluation 中給予 rolling Parkinson 一個不公平的「主場優勢」:目標函數就是它自己的平滑版本。

對研究系統的啟示

這個發現強化了我們的幾個研究原則:

  1.  永遠用 forward measure 做 OOS 評估 ——squared return 雖然 noisy,但它是投資人實際面對的量
  2.  跨資產驗證是必要的 ——G28 只在單一資產上得出結論,I2 的 7 資產驗證才揭示了真相
  3.  質疑「好得離譜」的結果 ——rolling average 媲美 GARCH?這應該觸發警報,而不是慶祝
  4.  GARCH 的地位再次確認 ——在正確的 evaluation framework 下,GARCH 仍然是日頻波動率預測的最佳選擇

結論

G28 的「Parkinson ≈ GARCH」不是一個關於預測能力的發現,而是一個關於 evaluation methodology 的教訓。當我們糾正了 evaluation target,GARCH 的優勢是壓倒性的(7/7 顯著)。

 Parkinson estimator 很優秀,作為波動率的測量工具。但測量和預測是兩件完全不同的事。 


Phase I 跨資產驗證系列 | 實驗 I2 | 2026-03-18

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
K1830:推論降價後 18 天,收盤波動三檔上升、高低價波動五檔全降——差在隔夜與盤中的共變數項
在短窗口事件研究裡,「事件後波動上升」這一句的真偽取決於用哪一個波動估計量。K1830 以二〇二六年七月三十日 OpenAI 調降推論價格為事件,比較五檔 ETF 事件前後各 18 個交易日的已實現波動。結果是:收盤對收盤波動在 IGV、QQQ、SPY 三檔上升,高低價(Parkinson)波動則在五檔全部下降。把收盤對收盤變異數拆成隔夜、盤中與兩者共變數之後,方向不一致的來源可以指認:主要來自原…
→
📄
K1378:VIX 長期成分讓 SPY 波動預測勝過 GJR-GARCH,這個優勢在疫情窗外更穩定
做風險控管或選擇權定價的人,常要在兩種日頻波動模型之間取捨:只用報酬本身的 GJR-GARCH,或在 GARCH 之外加一個由 VIX 驅動的長期成分。後者多了一個外部變數要維護,值不值得,要看它的預測優勢從哪裡來。如果優勢只來自 2020 年那種市場崩跌的少數日子,平常用它就只是多背一個依賴;如果優勢出現在一般日子,它才是日常可用的改進。 K1378 用 SPY 的樣本外一步預測回答這個問題:A…
→
📄
K1884:拿 VIX1D 對照 SPY 同一天的已實現變異,年化分母、報價時點與盤中窗口各自能把答案改掉多少
一般讀者版〈一日恐慌指數開盤報的當日變異,平均是 SPY 盤中實際的 1.56 倍:這個數字該怎麼讀〉給的是水準與讀法。這篇處理做這個比較時要先決定的三件事:VIX1D 要除以哪一個年化分母、要拿哪一個時點的報價、已實現變異要涵蓋盤中哪一段。 K1884 的結果顯示,這三個選擇造成的偏移,與要量的效果同一個量級;選錯任何一個,程式不會報錯,只會回答另一個問題。 先釐清估計量。K1884 量的是同一…
→