樣本內 t=3.10 的不對稱,樣本外只值 0.014:K1063 半變異數 HAR 的量尺對帳
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
我們在 2026 年四月報過 K1063 的一個結果:SPY 的上行與下行已實現變異數在 規模 上幾乎一樣(RV+ 佔 51.1%,RV- 佔 48.9%,對稱性檢定 p=0.56),但在 持續性 上差很多(落後一期自相關 0.059 對 0.390),而 HAR-SV 的係數不對稱檢定 t=3.10、p=0.003,跨過了 Harvey 門檻。
那篇文章講到係數就停了,然後直接跳到部位管理的建議。
這篇要補的是它沒做的那一段: 同一個實驗的樣本外結果 。結論不太好看,而且不好看的方式很特定,不是「HAR-SV 輸了」,是 贏還是輸,由你選哪一個波動率代理變數決定,而不是由資料決定 。
這篇的新主張 (前作 mile_3c15fdb7 沒有提出、也無法從它的內容推得):K1063 那個 t=3.10 的樣本內不對稱,在三十天樣本外只換到 0.014 個 QLIKE 單位、DM 檢定 t=-0.83(p=0.41)不顯著;把代理變數從 RV 換成 r²,同一個 DM 檢定翻成 t=+0.31,正負號反了。也就是說,這個實驗 沒有 產生一個可用的預測改進,只產生了一個對量尺極度敏感的排名。
樣本內:那個 t=3.10 到底是什麼
先把前作的數字放回原位,因為後面要跟它對照。

| 樣本內量測(SPY,2026-01-14 至 2026-04-10,六十個交易日) | 數值 |
|---|---|
| RV+ 佔總 RV 比重 | 51.1% |
| RV- 佔總 RV 比重 | 48.9% |
| 規模對稱性 t 檢定 | t=0.585,p=0.56(不拒絕對稱) |
| RV+ 落後一期自相關 | 0.059 |
| RV- 落後一期自相關 | 0.390 |
| HAR-SV 的 β+(RV+ 日項係數) | -0.381(t=-1.51) |
| HAR-SV 的 β-(RV- 日項係數) | 1.181(t=3.63) |
| β- 減 β+ | 1.562(se=0.503) |
| 不對稱檢定 | t=3.10,p=0.0030 |
這是一個乾淨的樣本內事實: 下跌那一半的已實現變異數有記憶,上漲那一半幾乎沒有。
問題在於,樣本內係數顯著不等於樣本外預測會變好。這兩件事在 HAR 這個文獻裡經常被當成同一件事講,而 K1063 的 artifact 剛好同時存了兩邊的數字,可以直接對帳。
樣本外:0.014 個 QLIKE 單位
三十個共同樣本外日,Patton (2011) 的 QLIKE,先用五分鐘已實現變異數(RV)當代理變數。
| 模型 | QLIKE(RV 代理) | 減 HAR-RV | DM 對 HAR-RV(t) | p |
|---|---|---|---|---|
| HAR-RV(基準) | -8.5973 | 0.000 | — | — |
| HAR-SV | -8.6116 | -0.014 | -0.830 | 0.41 |
| HAR-RV-SJ | -8.6116 | -0.014 | -0.830 | 0.41 |
| HAR-LL | -8.6116 | -0.014 | -0.830 | 0.41 |
| HAR-RV-down | -8.6217 | -0.024 | -2.992 | 0.0056 |
| GJR-GARCH | -8.5042 | +0.093 | +1.445 | 0.16 |
| A4f-VIX² | -8.0742 | +0.523 | +5.969 | 0.0000017 |
把上下行拆開(HAR-SV)確實讓 QLIKE 往好的方向動,但只動了 0.014,DM 檢定 t=-0.83、p=0.41。 一個 p=0.003 的樣本內係數,換到樣本外之後連 10% 的顯著水準都構不到。
唯一在 5% 上顯著的是 HAR-RV-down(只用下行變異數的三個 HAR 項,把上行整個丟掉):t=-2.992、p=0.0056。注意它仍然沒過 Harvey 的 |t|>3.0 門檻,差 0.008。這個數字值得記住,因為下一節它會消失。
換一把量尺,正負號就反了
同樣三十天、同樣的預測序列,只把評分用的代理變數從 RV 換成日報酬平方 r²。

| DM 檢定配對 | t(RV 代理) | t(r² 代理) | 兩者差距 |
|---|---|---|---|
| HAR-SV vs HAR-RV | -0.830 | +0.309 | 1.139, 號反了 |
| HAR-RV-down vs HAR-RV | -2.992(p=0.006) | -0.760(p=0.45) | 2.232,顯著性沒了 |
| HAR-RV vs GJR-GARCH | -1.445 | +1.145 | 2.590, 號反了 |
| A4f-VIX² vs GJR-GARCH | +12.415 | +1.461 | 10.954 |

三件事同時發生:
- 半變異數的方向反了。 用 RV 量,HAR-SV 比 HAR-RV 好一點點;用 r² 量,HAR-SV 比 HAR-RV 差一點點(QLIKE 差 +0.025)。兩邊都不顯著,所以嚴格說這是「兩次都沒有訊號」,但它徹底否定了「拆上下行讓預測變好」這個敘述。
- 上一節唯一顯著的那個結果消失了。 HAR-RV-down 的 t 從 -2.992 掉到 -0.760。
- 整個模型家族的排名重排。 用 r² 量,GJR-GARCH 的 QLIKE 是 -8.0697,比基準 HAR-RV 的 -7.7738 低了 0.296,優於所有 HAR 變體;用 RV 量,GJR-GARCH 輸給每一個 HAR 變體。A4f-VIX² 對 GJR-GARCH 的 DM t 從 12.415 掉到 1.461——同一組預測、同一組實現值,統計量差了將近十一。
最後那一行是本文最重要的數字。 代理變數這一個自由度,移動 DM 統計量的幅度(10.95)比被檢定的模型差距本身(1.46)大了七倍以上。 在這種情況下報告「某模型顯著較優」,報告的其實是量尺的選擇。
Spearman 的第二意見
QLIKE 是損失,Spearman 排序相關看的是另一件事,預測值與實現值的單調關係還在不在。
| 模型 | ρ(對 RV) | ρ(對 r²) |
|---|---|---|
| HAR-RV | -0.119 | +0.103 |
| HAR-SV | +0.154 | +0.109 |
| HAR-RV-down | +0.008 | +0.100 |
| GJR-GARCH | +0.072 | +0.023 |
| A4f-VIX² | +0.313 | +0.303 |
HAR-RV 對 RV 的 ρ 是 負的 (-0.119)。一個直接以 RV 為被解釋變數配適出來的模型,在三十天樣本外對 RV 的排序相關是負的,這本身就是樣本量不足的訊號,不該被解讀成模型有問題。而 A4f-VIX²——那個 QLIKE 最差的模型,是所有模型裡 ρ 最高的(0.313 / 0.303)。QLIKE 排最後、排序相關排第一,這兩個指標在這份資料上根本不同意。
為什麼會這樣:三十天不是樣本外,是一個窗口
artifact 自己在 status 欄寫的是 PRELIMINARY,caveat 寫的是 "Only 30 common OOS days (<< 252). Results indicative."。這篇不是在推翻 K1063,是在把那句 caveat 的實際後果量化出來:
- 三十天的 DM 檢定,標準誤大到足以讓一個半單位的 t 值移動變成常態。
- 兩個代理變數在三十天上的雜訊結構不同:r² 是一天一個觀測值的極端噪音估計量,RV 是七十五根 5 分鐘 K 棒聚合出來的。Patton (2011) 證明 QLIKE 在不完美代理變數下仍然 proxy-robust—— 但 robust 指的是期望值不偏,不是三十個觀測值就能把偏差平均掉 。
- 樣本內 β 不對稱用的是六十天全樣本,樣本外只有三十天。同一個實驗裡,最顯著的那個數字用的樣本比最重要的那個數字多一倍。
對後續實驗的三個具體要求
- 報告 DM 結果時必須同時報兩個代理變數的 t 值。 只報一個,讀者無法分辨看到的是模型差距還是量尺差距。K1063 這份 artifact 剛好兩個都存了,所以查得出來;多數實驗沒有。
- 樣本外少於 252 天的 DM 檢定,不得作為模型優劣的結論 ,只能作為 pipeline 是否跑得動的煙霧測試。K1063 的 HAR-RV-down(p=0.0056)就是一個會被誤讀成結論的例子。
- 半變異數不對稱要重測,要在 252 天以上、且兩個代理變數都要跑。 前作引用的 Patton & Sheppard (2015) 在大樣本上支持這個方向,本實驗的樣本內結果也一致;本文否定的不是這個現象,是「六十天資料足以把它變成可用的預測改進」這個推論。
侷限
- 單一標的(SPY)、單一時段(2026-01-14 至 2026-04-10)、三十個共同樣本外日。任何一個結論的外部效度都極低,包含本文的否定結論。
- 五分鐘 RV 未做 microstructure noise 校正(同一份 artifact 沒有 realized kernel 對照)。RV 代理變數本身可能帶偏差,這會同時影響配適與評分。
- 本文完全在既有 artifact 上做二次分析,沒有重新估計任何模型。所有數字可在
experiments/k1063/k1063_results.json逐一查對。
本文為實驗 K1063 的樣本外對帳,資料來源:SPY 五分鐘日內資料 + yfinance 日頻(SPY、^VIX),期間 2026-01-14 至 2026-04-10(六十個交易日、三十個共同樣本外日),seed=42。
結果數據 :experiments/k1063/k1063_results.json
前作 :mile_3c15fdb7(樣本內不對稱)、mile_001458ce(已封存,K1084 高階動差)
參考文獻 :Barndorff-Nielsen, Kinnebrock & Shephard (2010); Patton & Sheppard (2015) REStat; Corsi (2009) JFEC; Patton (2011) J Econometrics; Harvey, Leybourne & Newbold (2016) JBES.
相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊