同一組預測,兩把尺指向相反方向:K1718 日本波動六格 NULL 的損失函數依賴性
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
K1718 的公告結論只有一行:落後的美股 VIX 沒有通過任何一個預先註冊的日本股市波動增量預測格。零格通過,判定 NULL。
這篇不重講那個結論。給一般讀者的版本已經寫過(〈東京開盤前,紐約的恐慌指數已經收盤了:六格全掛的日本波動實驗〉,同一個 K,同一份結果檔)。這篇要處理的是那個 NULL 底下一個對做預測研究的人更有用的現象: 在同一組預測值上,Clark-West 檢定與 Patton QLIKE 這兩把尺,對其中兩格給出了方向相反的訊號 。預先註冊的通關條件同時要求兩者,所以這個分歧沒有影響最終判定;但它決定了這個 NULL 該怎麼被引用。
一、設定:先寫死,再看資料
| 項目 | 設定 |
|---|---|
| 標的 | 日經 225 指數(^N225)、NEXT FUNDS TOPIX ETF(1306.T) |
| 樣本 | 2015-02-06 至 2026-07-14/07-15(進模型後) |
| 樣本數 | 日經 225:2,794 日;TOPIX ETF:2,815 日 |
| 年化波動 | 21.58%/19.80% |
| 超額峰態 | 8.15/15.16 |
| 預測標的 | 次日調整後收盤對收盤對數報酬平方 |
| 模型家族 | GARCH、GJR、HAR-style log-r2(三個家族) |
| 樣本外 | 2020 至 2026,年度展開視窗,每年年初重估 |
| 資訊集 | VIX 來源日期嚴格早於日本目標日;落後中位數 1 日、最長 4 日 |
| 主排序損失 | Patton QLIKE |
| 主推論 | Clark-West(2007)巢狀 MSPE-adjusted,單尾,Holm 校正涵蓋六格 |
| 隨機種子 | 1718 |
通關條件在跑資料之前寫死,且是 連言 :加入 VIX 之後 QLIKE 要下降, 而且 Holm 校正後的 Clark-West 單尾 p<0.05。兩檔資產乘三個家族等於六格,六格全過為 ROBUST,一到五格為 PARTIAL,零格為 NULL。
共同評分遮罩要求實際值與六條預測同時有限且嚴格為正:日經 225 得到 1,594 個評分日(未丟棄),TOPIX ETF 得到 1,577 個(自 1,595 丟棄 18 個)。所有格子共用同一組評分日,避免用不同樣本比不同模型。
二、六格成績單:三個統計量並列
QLIKE 變動為正代表加入 VIX 後預測 變差 。Clark-West 的對立假設是「加了 VIX 的大模型在母體層次有增量預測力」,t 越大越支持它。QLIKE-DM 是同一組預測在主排序損失上的診斷檢定,正的 t 代表基準模型較優。
| 資產 | 家族 | QLIKE 變動 | CW t | CW 原始 p | CW Holm p | QLIKE-DM t | DM 雙尾 p | 通過 |
|---|---|---|---|---|---|---|---|---|
| 日經 225 | GARCH | +1.34% | 1.974 | 0.0242 | 0.1422 | 0.837 | 0.4029 | 否 |
| 日經 225 | GJR | +2.18% | 1.633 | 0.0512 | 0.2047 | 1.638 | 0.1017 | 否 |
| 日經 225 | HAR-r2 | +6.60% | -1.579 | 0.9428 | 1.0000 | 3.181 | 0.0015 | 否 |
| TOPIX ETF | GARCH | +1.20% | 1.983 | 0.0237 | 0.1422 | 0.880 | 0.3788 | 否 |
| TOPIX ETF | GJR | +1.58% | 1.254 | 0.1049 | 0.3147 | 1.678 | 0.0935 | 否 |
| TOPIX ETF | HAR-r2 | +3.69% | -1.586 | 0.9436 | 1.0000 | 3.612 | 0.0003 | 否 |
六格的 QLIKE 全部往上跑,第一個條件即全數出局;六格的 Holm 校正後 p 沒有一個低於 0.05,第二個條件也全數出局。通過格數為零。

三、分歧發生在哪裡
看兩個 GARCH 格。Clark-West 原始 p 分別是 0.0242 與 0.0237,若單獨挑出來報,會是「顯著」。但同一組預測在 QLIKE 上的 DM 檢定 t 只有 0.837 與 0.880,雙尾 p 分別 0.4029 與 0.3788——連「有差別」都說不出來,而且點估計是往變差的方向。
兩個 HAR 格則完全一致:CW t 為負,QLIKE-DM t 為 3.181 與 3.612(p=0.0015、p=0.0003),兩把尺都說加了 VIX 顯著更糟。
分歧只出現在 GARCH 家族。兩把尺都沒有壞,它們在問不同的問題。
Clark-West 問的是母體。 巢狀比較裡,大模型即使在母體層次多出來的係數為零,估計它仍要付出有限樣本的參數雜訊代價,所以樣本 MSPE 會被系統性地推高。CW 把這個代價加回去:
f^t=(σt2−h1t)2−[(σt2−h2t)2−(h1t−h2t)2]
其中 h1t 是基準預測、h2t 是加了 VIX 的預測。最後那項 (h1t−h2t)2 就是調整。CW 的虛無假設是「母體無增量預測力」,它回答的是「排除估計噪音之後,這個變數在母體裡有沒有東西」。
QLIKE 問的是這一組實際交出來的預測值好不好。
QLIKEt=htσt2−lnhtσt2−1
它不做任何有限樣本調整,也不對稱:高估與低估付的代價不同,尺度不變性讓它對「預測水準被整體推高」特別敏感。
所以那兩格的正確讀法是: 排除估計噪音後,VIX 有可能在母體裡帶了一點東西;但把估計噪音算進去、用實際交出來的預測值評分,它沒有留下任何可用的改善。 對打算把 VIX 疊到日本波動模型上的人來說,後者才是他會拿到的東西。
四、機制證據:VIX 進來的是水準,不是形狀
如果 VIX 只是把預測整體推高,QLIKE 會變差、排序能力不會改善,而 CW 的調整項有機會把它救回一點。資料正是這個樣子。
| 資產 | 家族 | 基準平均年化預測波動 | 加 VIX 後 | MSE 變化 | Spearman ρ 基準 → 加 VIX |
|---|---|---|---|---|---|
| 日經 225 | GARCH | 22.20% | 23.90% | 改善 | 0.1693 → 0.1688 |
| 日經 225 | GJR | 21.90% | 23.87% | 惡化 | 0.1996 → 0.1659 |
| 日經 225 | HAR-r2 | 41.17% | 55.08% | 惡化 | 0.1871 → 0.1681 |
| TOPIX ETF | GARCH | 19.37% | 21.77% | 惡化 | 0.1512 → 0.1771 |
| TOPIX ETF | GJR | 19.33% | 21.19% | 惡化 | 0.1816 → 0.1824 |
| TOPIX ETF | HAR-r2 | 251.77% | 457.00% | 惡化 | 0.1086 → 0.1291 |
六格的平均預測波動全部被推高,其中 HAR 家族被推得離譜(TOPIX ETF 那格從 251.77% 推到 457.00%,這個家族在日頻報酬平方上本來就不穩,這裡只作對照不作結論)。實際年化波動是 21.58% 與 19.80%,所以 GARCH 與 GJR 的基準預測本來就貼著實際值,VIX 把它們往上推兩個百分點左右,正是 QLIKE 會扣分的方向。

排序能力則幾乎沒有動:六格的 Spearman ρ 全部落在 0.11 到 0.20 這個窄帶裡,加了 VIX 之後有三格微升、三格微降,沒有一格出現量級變化。 水準被推高、形狀沒有改善 ,兩件事同時成立。
MSE 只有一格改善(日經 225 的 GARCH),而 CW 原始 p 最小的那格反而是 TOPIX ETF 的 GARCH,它的 MSE 是惡化的。這證實 CW 的訊號並非單純跟著樣本 MSE 走;把它推過門檻的是調整項本身。這正是 CW 該有的行為,也正是它不能單獨用來宣告「有預測力」的理由。
五、為什麼預先註冊的連言條件是對的
這個實驗如果只註冊一個條件,會得到三種不同的公告結論:
- 只要 Clark-West 原始 p<0.05:兩格通過,判定 PARTIAL,標題可以寫成「美股 VIX 對日股波動有增量預測力」。
- 只要 Clark-West 加 Holm:零格通過,NULL。
- 只要 QLIKE 方向:零格通過,NULL。
第一種寫法在技術上不算造假——CW 是巢狀比較的標準工具,原始 p 確實小於 0.05。它的問題是同時做六個檢定卻只報最小的那兩個,而且完全不揭露主排序損失往反方向動。連言條件加上 Holm 校正把這條路事前封死,這是這個實驗最值得引用的部分,比結論本身更值得。
同樣要講清楚的是這個 NULL 的邊界。它沒有證明美股 VIX 對日本波動沒有價值,它證明的是:在這個資訊集、這三個模型家族、這個評分損失與這段樣本外期間下,用「直接把落後 VIX 當外生變數加進去」這種方式,通不過事前訂好的門檻。條件式的價值(極端體制、事件窗、非線性設定)沒有被這個實驗回答,因為它問的是整段樣本的平均增量。
六、已揭露的限制
結果檔裡登記了六條限制,其中三條會直接影響上面的推論怎麼被引用:
- 日頻報酬平方是雜訊很大的波動代理,這裡的 HAR-style log-r2 並非以日內資料建構的 HAR-RV。HAR 家族那兩格的極端數值要放在這個前提下讀。
- Clark-West 用的是 MSE 調整,主排序損失卻是 QLIKE。第三節的整段分析就是這條限制的展開,不是在繞過它。
- 1306.T 的價格尺度在 2026 年 1:10 分割窗口有斷點,本輪先修好再算報酬(官方分割生效日 2026-04-01、交易調整起始 2026-03-30,兩列以 10.0 倍還原),並丟棄 2015-01-05 之前無法驗證的舊價格制度共 1,467 列。修復前後的值都登記在結果檔裡。稽核重跑後 TOPIX 軌道的年化波動是 19.80%,而非未修復快照的 99.79%。
另外,結果檔裡的波動目標策略帳本是探索性診斷:它的持有期是隔日開盤到再隔日開盤,與預測標的(收盤對收盤)不一致,不能當作部署證據,本文因此沒有引用它的任何績效數字。
七、這個 NULL 指向哪裡
對後續要做跨市場波動外溢的人,這份結果留下三個可以直接接手的位置:
第一,先確定要拿哪把尺當判準,再選檢定。 巢狀比較用 CW 是對的,但 CW 的 MSE 基礎與 QLIKE 排序不是同一件事。兩者不一致時,先看預測水準有沒有被系統性推移,那通常就是分歧的來源。
第二,落後一天的資訊集是這個設定最硬的約束。 VIX 來源日期的中位數落後 1 日、最長 4 日;嚴格 as-of 對齊與單純位移相比,有 143 個交易日會給出不同的來源列。跨時區外溢如果真的存在,它更可能存在於開盤跳空這個更短的窗口,而不是整天的收盤對收盤變異。
第三,把 VIX 當水準變數加進條件變異數方程式,在這裡是失效的形式。 六格的預測水準全部被推高、排序完全沒改善,這是設定形式的問題而不只是變數本身的問題。要繼續,該換的是形式(體制切換、門檻、只在極端分位啟用),不是換一個名字類似的變數再試一次。
資料來源 :Yahoo Finance via yfinance,auto_adjust=True,VIX 序列至 2026-07-15、日本資料至 2026-07-14/07-15。本文所有數值皆以程式方式讀自 experiments/k1718/k1718_results.json(reviewed run,Codex 稽核認證日 2026-07-16,四項完整性 gate 全數通過,重跑結果 verdict=NULL, cells=0/6)。同一份實驗的一般讀者版本見〈東京開盤前,紐約的恐慌指數已經收盤了:六格全掛的日本波動實驗〉。