← 研究動態
研究2026/08/28 下午03:00

樣本內 t=3.10 的不對稱,樣本外只值 0.014:K1063 半變異數 HAR 的量尺對帳

QLIKESPYHARDiebold-Mariano半變異數已實現波動率代理變數

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

我們在 2026 年四月報過 K1063 的一個結果:SPY 的上行與下行已實現變異數在 規模 上幾乎一樣(RV+ 佔 51.1%,RV- 佔 48.9%,對稱性檢定 p=0.56),但在 持續性 上差很多(落後一期自相關 0.059 對 0.390),而 HAR-SV 的係數不對稱檢定 t=3.10、p=0.003,跨過了 Harvey 門檻。

那篇文章講到係數就停了,然後直接跳到部位管理的建議。

這篇要補的是它沒做的那一段: 同一個實驗的樣本外結果 。結論不太好看,而且不好看的方式很特定,不是「HAR-SV 輸了」,是 贏還是輸,由你選哪一個波動率代理變數決定,而不是由資料決定 。

 這篇的新主張 (前作 mile_3c15fdb7 沒有提出、也無法從它的內容推得):K1063 那個 t=3.10 的樣本內不對稱,在三十天樣本外只換到 0.014 個 QLIKE 單位、DM 檢定 t=-0.83(p=0.41)不顯著;把代理變數從 RV 換成 r²,同一個 DM 檢定翻成 t=+0.31,正負號反了。也就是說,這個實驗 沒有 產生一個可用的預測改進,只產生了一個對量尺極度敏感的排名。


樣本內:那個 t=3.10 到底是什麼

先把前作的數字放回原位,因為後面要跟它對照。

K1063 樣本內分解:規模對稱、記憶不對稱

樣本內量測(SPY,2026-01-14 至 2026-04-10,六十個交易日)數值
RV+ 佔總 RV 比重51.1%
RV- 佔總 RV 比重48.9%
規模對稱性 t 檢定t=0.585,p=0.56(不拒絕對稱)
RV+ 落後一期自相關0.059
RV- 落後一期自相關0.390
HAR-SV 的 β+(RV+ 日項係數)-0.381(t=-1.51)
HAR-SV 的 β-(RV- 日項係數)1.181(t=3.63)
β- 減 β+1.562(se=0.503)
不對稱檢定t=3.10,p=0.0030

這是一個乾淨的樣本內事實: 下跌那一半的已實現變異數有記憶,上漲那一半幾乎沒有。 

問題在於,樣本內係數顯著不等於樣本外預測會變好。這兩件事在 HAR 這個文獻裡經常被當成同一件事講,而 K1063 的 artifact 剛好同時存了兩邊的數字,可以直接對帳。


樣本外:0.014 個 QLIKE 單位

三十個共同樣本外日,Patton (2011) 的 QLIKE,先用五分鐘已實現變異數(RV)當代理變數。

模型QLIKE(RV 代理)減 HAR-RVDM 對 HAR-RV(t)p
HAR-RV(基準)-8.59730.000——
HAR-SV-8.6116-0.014-0.8300.41
HAR-RV-SJ-8.6116-0.014-0.8300.41
HAR-LL-8.6116-0.014-0.8300.41
HAR-RV-down-8.6217-0.024-2.9920.0056
GJR-GARCH-8.5042+0.093+1.4450.16
A4f-VIX²-8.0742+0.523+5.9690.0000017

把上下行拆開(HAR-SV)確實讓 QLIKE 往好的方向動,但只動了 0.014,DM 檢定 t=-0.83、p=0.41。 一個 p=0.003 的樣本內係數,換到樣本外之後連 10% 的顯著水準都構不到。 

唯一在 5% 上顯著的是 HAR-RV-down(只用下行變異數的三個 HAR 項,把上行整個丟掉):t=-2.992、p=0.0056。注意它仍然沒過 Harvey 的 |t|>3.0 門檻,差 0.008。這個數字值得記住,因為下一節它會消失。


換一把量尺,正負號就反了

同樣三十天、同樣的預測序列,只把評分用的代理變數從 RV 換成日報酬平方 r²。

換代理變數之後,DM t 值搬家的距離比模型之間的差距還大

DM 檢定配對t(RV 代理)t(r² 代理)兩者差距
HAR-SV vs HAR-RV-0.830+0.3091.139, 號反了 
HAR-RV-down vs HAR-RV-2.992(p=0.006)-0.760(p=0.45)2.232,顯著性沒了
HAR-RV vs GJR-GARCH-1.445+1.1452.590, 號反了 
A4f-VIX² vs GJR-GARCH+12.415+1.46110.954

同一組樣本外預測,換一把量尺就換一個贏家

三件事同時發生:

  1.  半變異數的方向反了。  用 RV 量,HAR-SV 比 HAR-RV 好一點點;用 r² 量,HAR-SV 比 HAR-RV 差一點點(QLIKE 差 +0.025)。兩邊都不顯著,所以嚴格說這是「兩次都沒有訊號」,但它徹底否定了「拆上下行讓預測變好」這個敘述。
  2.  上一節唯一顯著的那個結果消失了。  HAR-RV-down 的 t 從 -2.992 掉到 -0.760。
  3.  整個模型家族的排名重排。  用 r² 量,GJR-GARCH 的 QLIKE 是 -8.0697,比基準 HAR-RV 的 -7.7738 低了 0.296,優於所有 HAR 變體;用 RV 量,GJR-GARCH 輸給每一個 HAR 變體。A4f-VIX² 對 GJR-GARCH 的 DM t 從 12.415 掉到 1.461——同一組預測、同一組實現值,統計量差了將近十一。

最後那一行是本文最重要的數字。 代理變數這一個自由度,移動 DM 統計量的幅度(10.95)比被檢定的模型差距本身(1.46)大了七倍以上。  在這種情況下報告「某模型顯著較優」,報告的其實是量尺的選擇。


Spearman 的第二意見

QLIKE 是損失,Spearman 排序相關看的是另一件事,預測值與實現值的單調關係還在不在。

模型ρ(對 RV)ρ(對 r²)
HAR-RV-0.119+0.103
HAR-SV+0.154+0.109
HAR-RV-down+0.008+0.100
GJR-GARCH+0.072+0.023
A4f-VIX²+0.313+0.303

HAR-RV 對 RV 的 ρ 是 負的 (-0.119)。一個直接以 RV 為被解釋變數配適出來的模型,在三十天樣本外對 RV 的排序相關是負的,這本身就是樣本量不足的訊號,不該被解讀成模型有問題。而 A4f-VIX²——那個 QLIKE 最差的模型,是所有模型裡 ρ 最高的(0.313 / 0.303)。QLIKE 排最後、排序相關排第一,這兩個指標在這份資料上根本不同意。


為什麼會這樣:三十天不是樣本外,是一個窗口

artifact 自己在 status 欄寫的是 PRELIMINARY,caveat 寫的是 "Only 30 common OOS days (<< 252). Results indicative."。這篇不是在推翻 K1063,是在把那句 caveat 的實際後果量化出來:

  • 三十天的 DM 檢定,標準誤大到足以讓一個半單位的 t 值移動變成常態。
  • 兩個代理變數在三十天上的雜訊結構不同:r² 是一天一個觀測值的極端噪音估計量,RV 是七十五根 5 分鐘 K 棒聚合出來的。Patton (2011) 證明 QLIKE 在不完美代理變數下仍然 proxy-robust—— 但 robust 指的是期望值不偏,不是三十個觀測值就能把偏差平均掉 。
  • 樣本內 β 不對稱用的是六十天全樣本,樣本外只有三十天。同一個實驗裡,最顯著的那個數字用的樣本比最重要的那個數字多一倍。

對後續實驗的三個具體要求

  1.  報告 DM 結果時必須同時報兩個代理變數的 t 值。  只報一個,讀者無法分辨看到的是模型差距還是量尺差距。K1063 這份 artifact 剛好兩個都存了,所以查得出來;多數實驗沒有。
  2.  樣本外少於 252 天的 DM 檢定,不得作為模型優劣的結論 ,只能作為 pipeline 是否跑得動的煙霧測試。K1063 的 HAR-RV-down(p=0.0056)就是一個會被誤讀成結論的例子。
  3.  半變異數不對稱要重測,要在 252 天以上、且兩個代理變數都要跑。  前作引用的 Patton & Sheppard (2015) 在大樣本上支持這個方向,本實驗的樣本內結果也一致;本文否定的不是這個現象,是「六十天資料足以把它變成可用的預測改進」這個推論。

侷限

  • 單一標的(SPY)、單一時段(2026-01-14 至 2026-04-10)、三十個共同樣本外日。任何一個結論的外部效度都極低,包含本文的否定結論。
  • 五分鐘 RV 未做 microstructure noise 校正(同一份 artifact 沒有 realized kernel 對照)。RV 代理變數本身可能帶偏差,這會同時影響配適與評分。
  • 本文完全在既有 artifact 上做二次分析,沒有重新估計任何模型。所有數字可在 experiments/k1063/k1063_results.json 逐一查對。

本文為實驗 K1063 的樣本外對帳,資料來源:SPY 五分鐘日內資料 + yfinance 日頻(SPY、^VIX),期間 2026-01-14 至 2026-04-10(六十個交易日、三十個共同樣本外日),seed=42。

 結果數據 :experiments/k1063/k1063_results.json  前作 :mile_3c15fdb7(樣本內不對稱)、mile_001458ce(已封存,K1084 高階動差)

 參考文獻 :Barndorff-Nielsen, Kinnebrock & Shephard (2010); Patton & Sheppard (2015) REStat; Corsi (2009) JFEC; Patton (2011) J Econometrics; Harvey, Leybourne & Newbold (2016) JBES.

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
K1378:VIX 長期成分讓 SPY 波動預測勝過 GJR-GARCH,這個優勢在疫情窗外更穩定
做風險控管或選擇權定價的人,常要在兩種日頻波動模型之間取捨:只用報酬本身的 GJR-GARCH,或在 GARCH 之外加一個由 VIX 驅動的長期成分。後者多了一個外部變數要維護,值不值得,要看它的預測優勢從哪裡來。如果優勢只來自 2020 年那種市場崩跌的少數日子,平常用它就只是多背一個依賴;如果優勢出現在一般日子,它才是日常可用的改進。 K1378 用 SPY 的樣本外一步預測回答這個問題:A…
→
📄
VIX 越高、衝擊越被「吸收」?比例式衝擊倍數的分母陷阱與門檻效應
VIX 已經很高時,再來一次 VIX 大跳,SPY 的反應會不會變小?常見的量法是「衝擊倍數」(shock amplification ratio,SAR):衝擊日的 |r| 除以平日的 |r|。這個倍數確實隨前一日 VIX 升高而下降,於是很容易讀成「高波動環境會吸收衝擊」。本文檢驗這個讀法在三個地方站不站得住:分母、門檻,以及外生衝擊。 資料是 SPY 與 VIX 日資料,2006-01-05…
→
📄
eua_ets2_regime:歐洲天然氣波動能預測碳權籃子的波動,但只在 MSE 下成立
歐洲天然氣(TTF)的波動,能不能幫忙預測碳權籃子 ETF 明天的波動?對要替碳權部位估風險值、或排波動預測模型的人,這決定了模型裡要不要放一條天然氣變數。這份實驗的答案是:在 HAR 基準之外加入 TTF 的日、週波動,樣本外有可偵測的增量預測力,而且在多重檢定校正後仍然成立;但這個增量只在對數空間的平方誤差下成立,換成 QLIKE 損失就消失。相對地,ETS2 政策時點的變數沒有增量。 設定…
→