台灣金融壓力指標對台積電波動沒有預警能力,而它在樣本內看起來很有
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
K1432 的結論是 NULL。四個事先宣告的金融壓力指標,沒有一個在樣本外改善台積電已實現波動的預測;把它們加進 HAR-RV 基準,十五次比較有十五次讓損失變大,其中六次大到統計上顯著。
這個結果值得寫,因為同一批指標在樣本內的表現完全相反。它們通過 Granger 因果檢定,p 值小到 1.05e-5。同一組資料、同一組指標,換一個問法就換一個答案,而那兩個問法問的本來就是兩件事。
這個實驗量了什麼
標的是 2330.TW 的已實現波動。結果檔的 rv_definition 欄逐字寫著 Rolling 21d sum of squared daily log returns (variance), target uses log(RV)——21 個交易日的日對數報酬平方和當變異數,預測目標取對數。樣本從 2010-01-01 到 2026-06-09,訓練段到 2020-12-31 為止共 2814 個觀測,樣本外從 2021-01-01 起共 1397 個,合計 4211 個。資料來源是 yfinance,seed 固定為 42。
三個基準模型:B1_AR1(log(RV_t) -> log(RV_{t+h}))、B2_HARRV(Corsi 2009 的 HAR-RV,對數空間)、B3_HARRV_VIX(HAR-RV 再加 log(^VIX))。
四個事先宣告的壓力指標,全部由五檔金融股(2881 富邦、2882 國泰、2891 中信、2884 玉山、2880 華南)建構:
- S1 :五檔金融股 21 日已實現變異數的橫斷面平均。
- S2 :日內最高減最低報酬離散度的 21 日滾動標準差。
- S3 :金融股平均報酬減 0050.TW 報酬的 5 日滾動平均。
- S4 :21 日滾動的 PC1 分數絕對值,載荷只用訓練段配適。
預測期距 1、5、10 個交易日,損失函數用 MSE 與 Patton (2011) 的 QLIKE,比較用 Diebold-Mariano 檢定加 Newey-West HAC 變異數(截斷落後 = h−1),再套 Harvey, Leybourne, Newbold (1997) 的小樣本修正,雙尾 p 值以 t 分配(自由度 n−1)計算。
樣本內:四個指標裡有三個過關
全樣本 Granger 因果檢定,落後期 1 到 10:
| 指標 | 顯著落後期數 | 最小 p 出現在 | F | p |
|---|---|---|---|---|
| S1 橫斷面波動 | 9 / 10 | 落後 4 | 7.1147 | 1.049e-05 |
| S2 離散度 | 9 / 10 | 落後 2 | 7.9082 | 3.732e-04 |
| S4 PC1 | 8 / 10 | 落後 4 | 4.5944 | 1.058e-03 |
| S3 相對弱勢 | 0 / 10 | 落後 1 | 0.0033 | 9.542e-01 |
S1 從落後 2 期到落後 10 期全部顯著,只有落後 1 期不顯著(p = 0.1886)。這是很乾淨的樣本內證據:金融股的橫斷面波動確實領先台積電的波動。
S3 是這批指標裡的對照組。它十個落後期一個都沒過,最小 p 值 0.954。同一支程式跑出兩種極端,代表這個檢定的鑑別力沒有壞掉。

樣本外:事先宣告的十五次比較,十五次方向相反
事先宣告的成功判準只看一件事:B2_HARRV 對上 B2_HARRV+<壓力指標>,用 QLIKE,DM 統計量為正(代表加了指標的模型損失較低)且 p < 0.05。五個設定(S1、S2、S3、S4、四個一起加)乘三個期距,共十五次比較。
十五次的 DM 統計量全部為負。 沒有任何一次是正的,所以 notable_passes 是空陣列,verdict 落在 NULL。
其中八次負得顯著:
| 期距 | 比較 | DM | p |
|---|---|---|---|
| h=1 | B2 vs B2+S3 | −2.0916 | 0.036654 |
| h=1 | B2 vs B2+S4 | −2.2265 | 0.026140 |
| h=5 | B2 vs B2+S1 | −2.5986 | 0.009458 |
| h=5 | B2 vs B2+S4 | −2.8245 | 0.004803 |
| h=5 | B2 vs B2+all | −3.1227 | 0.001829 |
| h=10 | B2 vs B2+S1 | −2.9026 | 0.003759 |
| h=10 | B2 vs B2+S4 | −2.7046 | 0.006922 |
| h=10 | B2 vs B2+all | −3.2464 | 0.001196 |
最負的一次是 h=10 的 B2 vs B2+all:DM = −3.2464、p = 0.001196。把四個指標一起加進去,樣本外損失顯著變大。
S4 是唯一在三個期距都顯著讓預測變差的設定。
樣本內領先關係最強的 S1,在 h=5 與 h=10 都顯著讓預測變差。

有一組讀數方向相反,一起放上來
同一份結果檔裡有一組正向的顯著結果,它不在事先宣告的比較家族裡,但把它藏起來就不誠實了。
S4 加在 VIX 基準(B3_HARRV_VIX)上,六個讀數全部為正,五個顯著:
| 期距 | 損失 | DM | p | 平均損失差 | 相對基準 |
|---|---|---|---|---|---|
| h=1 | MSE | 1.3351 | 0.182064 | 2.869e-05 | 1.563e-03 |
| h=1 | QLIKE | 2.1878 | 0.028853 | 2.752e-05 | 6.587e-06 |
| h=5 | MSE | 1.9640 | 0.049729 | 1.007e-03 | 9.875e-03 |
| h=5 | QLIKE | 2.7304 | 0.006406 | 8.649e-04 | 2.095e-04 |
| h=10 | MSE | 2.2327 | 0.025725 | 4.650e-03 | 2.274e-02 |
| h=10 | QLIKE | 2.6769 | 0.007518 | 4.009e-03 | 9.874e-04 |
三件事同時成立,缺一件就會讀錯:
第一,這不在事先宣告的判準裡。 判準寫的是「對上 B2_HARRV、用 QLIKE」,這組是「對上 B3_HARRV_VIX」。事前指定的家族是十五次比較,這六次是事後看到的。要把它當結論,需要一個新實驗來事先宣告它。
第二,多重檢定的分母是 54。 全部壓力指標的擴充比較(三個期距 × 兩種損失 × 九組配對)共 54 次,p < 0.05 的有 19 次。純機率下 54 × 0.05 = 2.7 次,所以 19 次不能全歸給運氣,但那 19 次裡有 14 次的方向是「加了指標更差」,只有 5 次是「更好」,而 5 次全部落在 S4 加 VIX 這一組。
第三,h=1 那一格統計顯著、量級是零。 QLIKE 的改善是 2.752e-05,相對基準 4.178 的比例是 6.587e-06。1397 個樣本外觀測讓這個差異在統計上站得住,但它不會改變任何一個決策。同一組在 h=10 的 MSE 相對改善是 2.274%,那個量級才有討論價值,代價是它的 p 值 0.0257 要放在上一段那整批擴充比較裡看,而不是單獨讀。
同一套檢定抓得到 VIX,所以它不是死的
一個 null 最容易的解釋是量尺壞了。這份結果檔裡有現成的對照:同一套 DM 設定拿去比兩個基準模型。
B2_HARRV 對上 B3_HARRV_VIX,也就是問「加進 VIX 有沒有用」:
| 期距 | MSE:DM / p | QLIKE:DM / p |
|---|---|---|
| h=1 | 2.1863 / 0.028963 | 1.9757 / 0.048390 |
| h=5 | 2.0808 / 0.037637 | 1.7613 / 0.078409 |
| h=10 | 1.4857 / 0.137580 | 1.0056 / 0.314804 |
h=1 兩種損失都顯著為正,h=5 的 MSE 也顯著。同一個檢定、同一段樣本外、同一個 HLN 修正,它抓得到 VIX 帶進來的增量資訊。所以四個本地壓力指標拿不到正向顯著,來自指標本身,不是來自檢定沒有鑑別力。
同一張表還有另一格值得看:B1_AR1 對上 B2_HARRV,三個期距六個讀數沒有一個顯著(最大的是 h=1 的 MSE,DM = 1.3234、p = 0.185918)。在這個標的與這段期間,HAR-RV 的三時間尺度結構相對於單純的 AR(1),本身就沒有取得顯著優勢。這件事會回頭限制上面所有比較的解讀:基準之間的差距本來就很窄,任何增量資訊要在這裡顯著都不容易。
這個 null 的檢定力上界
每一次 DM 檢定的樣本外觀測數都是 1397,三個期距共用同一段樣本外期間,所以三個期距的結果彼此不獨立。Granger 檢定用全樣本,落後 4 期時的自由度是 [4229, 4]。
DM 統計量已套 HLN 小樣本修正,這個修正會把統計量往零縮,讓顯著更難取得,所以「沒有正向顯著」這件事,有一部分來自這個保守的口徑。反過來說,十五次全負、六次顯著為負,是修正之後仍然成立的。
樣本外只有 2021-01-01 之後這一段。這段期間台積電經歷過 2021 的高檔震盪與 2022 的下跌,但它終究是單一段連續期間,不是多個獨立的樣本外窗口。
還有一件事這個實驗沒做:壓力指標的建構方式本身沒有被搜尋過。四個設定是事先寫死的,這是它能當作預先宣告判準的原因,也是它的上界,換一組視窗長度、換一組成分股、換一種標準化方式,答案可能不同,而這個實驗量不到那些。
所以這個 null 的範圍是: 這四個指標、這個標的、這段期間、這三個期距、這兩種損失函數之下,沒有樣本外改善。 它沒有證明台灣金融壓力與台積電波動無關,樣本內的 Granger 結果本身就否定了那個更強的說法。
接下來能做什麼
樣本內顯著而樣本外無用,最常見的解釋是領先關係存在但太弱,弱到被 HAR-RV 自身的長記憶結構吃掉。HAR-RV 已經用日、週、月三個時間尺度的已實現波動當解釋變數,而金融股的橫斷面波動與台積電的波動同時受市場層級因子驅動——S1 帶進來的資訊,有多少是 HAR-RV 已經有的,這個實驗沒有拆開。
三個可以續做的方向:把壓力指標對 HAR-RV 三項殘差化之後再測增量;換一個目標函數,例如壓力指標對尾端風險(VaR 違約率)而非平均損失的貢獻;或把樣本外切成多個非重疊窗口,看 S4 加 VIX 的那組正向結果在不同窗口是否穩定。
資料與程式 :experiments/k1432/k1432_tw_financial_stress.py、experiments/k1432/k1432_tw_financial_stress_results.json。圖:experiments/k1432/figures/stress_and_rv.png、experiments/k1432/figures/qlike_by_horizon.png。
方法文獻 :Corsi (2009)、Patton (2011)、Adrian & Brunnermeier (2016)、Diebold & Mariano (1995)、Harvey, Leybourne & Newbold (1997)。