接一個外生指標進 HAR 之前,先量它的天花板
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
這篇要回答的是一個排程問題,不是一個真偽問題
手上有一個外生指標,想接進 HAR 波動率模型。做這件事的完整成本不是寫幾行迴歸,是:建對齊管線、決定用哪個 RV proxy、切樣本外、挑檢定、做多重比較校正、再把整套凍成可復現的產物。以我們自己的紀錄,這一輪從資料落地到結果檔封存要花掉一個研究班次以上。
所以真正要先回答的問題是: 這個指標值不值得走完整條流水線? 而不是「它到底有沒有效」。
K1721 提供的,是這個排程問題的一個具體答案模板。它測的是 Caldara 與 Iacoviello 的每日地緣政治風險指數,拆成 Acts(GPRD_ACT,已發生事件)與 Threats(GPRD_THREAT,尚未發生的威脅言論)兩支,加進標準 HAR 之後對四檔 ETF、三個期距、兩種 RV proxy 做增量預測檢定。結果檔的 verdict 欄位是 NULL。
但這篇不打算停在 NULL。停在 NULL 只回答了「這個指標」,浪費掉的是這批資料裡另一件對下一個題目更有用的東西: 一個在跑任何樣本外檢定之前就能算出來、而且算起來只要幾秒鐘的上界 。
設定
基準是 HAR:用 RV 的日、週、月三個成分預測 h 期後的平均 RV。這是波動率增量檢定的常見對照,因為它把「波動率群聚」這條最強的訊號先吃掉,剩下的才是外生變數真的多帶進來的資訊。
| 設計維度 | 取值 |
|---|---|
| 標的 | SPY 大盤、GLD 黃金、XLE 能源、ITA 航太國防 |
| 期距 h | 一、五、二十二 |
| RV proxy | Parkinson 高低價區間(主)、收盤對收盤報酬平方(穩健性) |
| 樣本 | 1990-01-01 至 2026-06-16,各標的取自身上市以來可用區間 |
| 樣本外切法 | 展開窗,後 40% 為考場,min_train 500 |
| 樣本內推論 | HAC,hac_maxlags 6 |
| 樣本外推論 | Clark-West 單尾(巢狀模型),HAC lag 隨期距調整 |
| 多重比較 | Holm,三個檢定族各 12 次 |
| 隨機種子 | 42 |
四個模型:M0 為純 HAR,MA 加 GPRA,MT 加 GPRT,MAT 兩者都加。embargo_verified 在每一格都是 true,被預測期間不進訓練集。
先量天花板:樣本內的增量 adjusted R²
在碰樣本外之前,先問一個更便宜的問題: 就算完全不管過擬合,把兩支指數塞進樣本內迴歸,判定係數最多能往上抬多少?
這是一個上界。樣本外的增量不可能系統性地超過它。

二十四格(四檔標的乘三個期距乘兩種 proxy)裡,最大的增量是 0.0010857,也就是 0.109 個百分點,出現在 SPY 的二十二日期距、Parkinson proxy。最小的是 -0.0002146。二十四格裡有十二格是負的,加了變數之後 adjusted R² 反而下降,代表那兩個係數連自己的自由度都賺不回來。
具體看兩格。SPY 的一日期距:HAR 的 adjusted R² 是 0.5452737724599485,加上兩支指數之後是 0.5453095706917581,變動落在小數點第四位。SPY 的二十二日期距是全表最好的一格:0.6012088183049068 對 0.6022945093127623。
這個數字就是決策點。 一個在樣本內、不設任何懲罰、還挑最好的一格,也只值 0.109 個百分點的增量,在樣本外要跨過統計顯著門檻需要的樣本量,遠超過任何日頻 ETF 序列能提供的長度。換句話說,樣本外檢定的結果在跑之前就已經被這張圖限制住了。
樣本外:七十二次 Clark-West,沒有一次在校正前低於 0.05
還是把樣本外跑完了,因為上界論證是啟發式的,不是證明。
| 標的 | h | 考場起點 | n_oos | ΔadjR² | CW(+GPRT)p | CW(joint)p | RMSE 改善 % | QLIKE 改善 % |
|---|---|---|---|---|---|---|---|---|
| SPY | 1 | 2013-02-14 | 3352 | +0.000036 | 0.4951 | 0.5341 | -0.0423 | -0.7964 |
| SPY | 5 | 2013-02-12 | 3350 | +0.000238 | 0.1086 | 0.1759 | +0.0142 | -0.4158 |
| SPY | 22 | 2013-01-28 | 3344 | +0.001086 | 0.1085 | 0.2185 | -0.0041 | -0.3865 |
| GLD | 1 | 2017-11-03 | 2162 | -0.000215 | 0.8095 | 0.8329 | -0.1027 | -1.9347 |
| GLD | 5 | 2017-11-01 | 2160 | -0.000072 | 0.7795 | 0.8773 | -0.2688 | -1.6288 |
| GLD | 22 | 2017-10-17 | 2154 | +0.000517 | 0.4123 | 0.4866 | -0.4330 | -3.9908 |
| XLE | 1 | 2015-06-29 | 2756 | -0.000096 | 0.7103 | 0.8171 | -0.0459 | -0.6099 |
| XLE | 5 | 2015-06-25 | 2754 | -0.000004 | 0.4836 | 0.6763 | -0.0496 | -0.5146 |
| XLE | 22 | 2015-06-10 | 2748 | +0.000156 | 0.4540 | 0.5821 | -0.1206 | -0.8255 |
| ITA | 1 | 2018-06-07 | 2015 | -0.000121 | 0.9880 | 0.9400 | -0.4317 | -2.6940 |
| ITA | 5 | 2018-06-04 | 2014 | -0.000016 | 0.9453 | 0.8645 | -0.7361 | -4.1700 |
| ITA | 22 | 2018-05-18 | 2007 | +0.000241 | 0.7673 | 0.5960 | -0.6465 | -2.6890 |
(Parkinson proxy;p 值為 Clark-West 單尾,未校正)
把兩種 proxy、三種巢狀設定(+GPRA、+GPRT、joint)全部攤開,一共是七十二次 Clark-West 檢定。校正前低於 0.05 的次數是零。全域最小的單尾 p 是 0.1085,落在 SPY 的二十二日期距、Parkinson proxy、只加 GPRT 的設定上。
Holm 校正分三族做,每族 12 次:樣本外 joint 對 HAR、樣本外 +GPRT 對 HAR、樣本內不對稱性對比。三族的 n_significant 都是 0,校正後的 p 值全部被推到上限。
兩種損失函數會讓同一格看起來差一個數量級
這張圖是這批資料裡對其他題目最有轉用價值的一段。

同樣是 SPY 的一日期距:RMSE 改善率 -0.0423%,QLIKE 改善率 -0.7964%。換成收盤對收盤 proxy 的 GLD 二十二日期距,兩者是 -0.7489% 對 -6.1318%。差距接近一個數量級。
方向倒是穩的。二十四格裡只有一格的 RMSE 改善率為正——SPY 的五日期距、Parkinson proxy,+0.0142%——而同一格的 QLIKE 改善率是 -0.4158%。
實務含意很直接: 只報 RMSE 的人會把這件事寫成「幾乎沒有差別」,只報 QLIKE 的人會寫成「明顯變差」,兩個都對,兩個都不完整。 QLIKE 對低波動區的相對誤差敏感得多,而 GPR 指數的雜訊正好集中在平靜期,那正是它最容易把預測值推歪的地方。
還要補一句:這兩個都是描述性的水準指標,不帶推論。模型是巢狀的,所以不做 DM 檢定;顯著性一律由 Clark-West 承擔。結果檔自己在 qlike_note 裡寫了這件事,這裡照抄不是為了謹慎,是因為把 QLIKE 差距當成證據正是這類文章最常見的越界。
唯一方向相符的資產,換一個 proxy 就翻號
如果只看 Parkinson proxy,ITA 是四檔裡唯一在方向上支持「威脅比事件更有資訊」的:三個期距的 Threats 減 Acts 對比 t 值都是正的,一日期距那格最大,1.3776。

三件事讓這個方向站不住,而且要一起講:
第一,統計上不成立。ITA 一日期距的雙尾 p 是 0.1683,是全表最小的一個,離門檻仍有距離;Holm 之後同樣歸零。
第二,正號的來源和故事對不上。同一格裡 Acts 的 joint 係數 HAC t 是 -1.6610,Threats 是 +0.7486。對比之所以為正,主因是事件端轉負,不是威脅端變強。原本的機制假說要的是後者。
第三,換 proxy 就不見了。收盤對收盤 proxy 下,ITA 的三個 t 值變成 +0.5900、+0.1787、-0.7084——二十二日期距直接翻號。一個對 RV proxy 選擇如此敏感的方向性,本來就不該被寫成「方向上有支持」。
而且 ITA 在考場上是全表最差的。一日期距只加 GPRT 的 Clark-West t 是 -2.2574,方向與「有增量預測力」完全相反。
這個 null 換來的兩條可重用規則
一、把上界計算排到樣本外流水線前面。 樣本內增量 adjusted R² 幾秒鐘就能算完,而它給的是整條流水線可能產出的最好結果。若這個上界已經在小數點第三位,後面的展開窗、Clark-West、Holm 就不是在檢定假說,是在確認一件已知的事。K1721 的完整執行耗時 70.023 秒,成本主要不在計算,在設計與封存,那部分才是上界計算能省下來的。
二、方向性宣稱要先過 proxy 對照,再過顯著性。 ITA 這一格是典型:在單一 proxy 下有方向、有故事、有敘事價值,只有換一把量尺才看得出它不穩。這個順序很重要,因為方向性論述常常被寫在顯著性不足的免責聲明後面當作補償,而 proxy 對照能在更早的階段就把它擋掉。
第二條有個直接的推論,值得寫給下一個做同類題目的人: 穩健性檢查不該只當附錄。 這篇裡的收盤對收盤 proxy 如果只在文末補一句「結論不變」,讀者就拿不到 ITA 翻號這件事,而那正是這批資料裡唯一有鑑別力的地方。
可復現性
輸入全部凍在 experiments/K1721/data/,逐檔帶 sha256:GPR 日頻原始 xls、四檔 ETF 的 OHLC CSV。腳本 K1721.py 的 sha256 是 1ebd6d71c2dd1bf7c974ef09d911971bb2d5adc07e29a5cc5b7572c62a5a0382。重跑不連網,數字不會因為資料源當下的狀態而變。結果檔的 self_check.passed 為 true,unresolved 為空陣列。
限制講清楚:四檔標的的考場起點不同(SPY 起於 2013 年,ITA 起於 2018 年),因為 40% 的樣本外比例套在長度不一的上市歷史上。所以 Holm 的 m=12 在多重性上是保守的,但十二格涵蓋的市場狀態並不對齊,這批檢定不能讀成「同一個時期的十二次獨立測試」。要對齊時期就得犧牲 SPY 的長樣本,這是設計取捨,不是瑕疵。
另外,這裡測的是日頻線性增量。GPR 指數在事件窗內的非線性反應、或它與隱含波動率而非已實現波動率的關係,都不在這次的範圍裡。這篇不宣稱那些方向也不成立。
與同一實驗的讀者版之間
同一份結果檔另有一篇面向一般讀者的文章,講的是「新聞出現的密度不等於可用的預測資訊」,主張落在資產配置的直覺上。
這篇的主張不同: 在跑增量檢定之前先算樣本內上界,可以把大部分外生指標題目的檢定預算提前結掉。 讀者版談的是這個指標的結論,這篇談的是這類研究的排程。兩篇共用同一批數字,但可以被獨立推翻,上界規則就算在別的指標上被證明太寬鬆,K1721 對 GPR 的結論不受影響,反之亦然。
資料來源 :Caldara & Iacoviello(AER 2022)每日地緣政治風險指數之 GPRD_ACT 與 GPRD_THREAT 子指數,data_gpr_daily_recent.xls,涵蓋 1985-01-01 至 2026-06-15;yfinance 日線 OHLC(auto_adjust=False),涵蓋至 2026-06-15。完整結果檔 experiments/K1721/K1721_results.json,生成於 2026-09-02。