K1876:GVZ 預警黃金回撤的 regime 交互假說被推翻,而且這份樣本的 R=1 月份幾乎只出現在 2013–2016
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
一般讀者版(〈持有黃金,20 天內從高點回落 5% 的機率約四分之一〉)講的是結論:GVZ 做成的事前預警,樣本外勝不過歷史發生率。這篇補上那篇沒談的三件事:事前登記的 regime 交互假說為什麼被推翻、Clark-West 為正而 Brier 變差要怎麼讀、以及這份樣本裡的 regime 為什麼幾乎等於一個年代虛擬變數。
設定
- 事件 :起點 t 之後 20 個交易日內,GLD 收盤價自期間高點回落超過 5%。起點 2010-06-01 至 2026-08-21,共 4082 個,事件率 26.0%。
- 特徵 :log GVZ 相對過去 252 日均值的 z 分數,取 t−1 的值。
- Regime :每月第一個交易日,用前 500 筆 GLD 日報酬配適一階 GJR-GARCH。槓桿項 γ>0(下跌衝擊推高波動,股票式的標準槓桿)記 R=1,γ<0(上漲衝擊推高波動,黃金常見的反向槓桿)記 R=0。另報 1000 筆窗長的敏感度。
- 模型 :M0 為訓練期事件率;M1 為 probit(y ~ z);M2 為 probit(y ~ z + R + z·R)。
- 事前登記的 H1 :交互項 β_zR > 0,也就是在標準槓桿月份,GVZ 升高更可能對應下跌。機制依據是 Baur (2012) 對黃金反向非對稱波動的描述:反向槓桿月份的 GVZ 升高多半來自上漲,拿來預警下跌應該比較弱。
結果一:交互項方向與假說相反
全樣本 probit M2(HAC 落後 19):
| 係數 | 窗長 500 | t | 窗長 1000 | t |
|---|---|---|---|---|
| z(R=0 斜率) | 0.191 | 3.47 | 0.144 | 2.38 |
| z·R | −0.106 | −0.84 | −0.017 | −0.13 |
| R=1 斜率(z + z·R) | 0.085 | 0.74 | 0.127 | 1.15 |

交互項在兩個窗長都是負的,點估計方向與假說相反。z 斜率在反向槓桿月份是 0.191,HAC 落後 41 時 t 仍有 3.24;在標準槓桿月份是 0.085,區間跨過零。兩者的差(z·R)並不顯著,t 只有 −0.84 與 −0.13;窗長 1000 時兩個斜率幾乎相同。R=0 有 3156 個起點,R=1 只有 926 個,檢定力本來就偏向 R=0。依 README Part I 的認錯條件,「GVZ 的回撤預警方向隨 regime 反轉、分 regime 才有用」這條選題前提已撤回。
原始事件率本身並沒有反過來:R=1 的 926 個起點裡有 276 個事件,事件率 29.8%,R=0 是 24.8%。標準槓桿月份的事件率較高,但在那些月份裡,未能拒絕 GVZ 斜率為零。
結果二:Clark-West 為正,Brier 卻變差
樣本外從 2013-01-02 起,共 3430 個起點,每月用當時可得資料重估,共 165 次:
| 比較 | Brier(小模型) | Brier(大模型) | CW t | CW 單尾 p | 判定 |
|---|---|---|---|---|---|
| M1 vs M0 | 0.1899 | 0.1907 | 1.62 | 0.0531 | 不支持 |
| M2 vs M0 | 0.1899 | 0.1941 | 1.45 | 0.0738 | 不支持 |
| M2 vs M1 | 0.1907 | 0.1941 | −0.14 | 0.5559 | 不支持 |
M1 的原始 Brier 比 M0 差,CW 統計量卻是正的。這兩個結果可以同時成立,因為 Clark-West 會先把大模型多估參數帶來的雜訊項加回去再比,檢定的是「母體係數是否為零」;原始 Brier 衡量的是「用這份樣本估出來的係數,實際預測時有沒有比較準」。CW 單尾 p = 0.0531,未達 0.05。點估計方向偏向 GVZ 有增量資訊,但就算存在,在擴張窗、每月重估、最短 500 筆訓練資料的條件下,估計誤差也足以讓原始 Brier 變差。兩項都沒有達到事前門檻(t > 3,或單尾 p < 0.05 且三期中兩期勝出)。
M2 對 M1 的 CW t 只有 −0.14,加入 regime 沒有帶來增量。把窗長換成 1000 筆,M2 對 M0 的 CW t 掉到 −0.32。regime 交互帶進來的看起來主要是估計雜訊。
結果三:這份樣本裡的 regime,大致等於 2013–2016

R=1 的月份幾乎都在第一段:2013–2016 占 77.2%,2017–2021 占 8.3%,2022–2026 為 0.0%。樣本外 883 個 R=1 起點裡有 258 個事件,全部落在 2013–2016。所以「R=1 與 R=0 的斜率差」在這份資料裡無法和「2013–2016 與其他年代的差」分開,H1 的檢定力也受此限制;README Part I.7 已事前寫明這一點。
分期來看也是如此。M2 相對 M0 的 Brier 差,在 2013–2016 是 −0.0200,是三段裡最差的;到了 2022–2026 變成 +0.0096,M1 同期是 +0.0100。這一段完全沒有 R=1 月份,M2 的預測等於只用 R=0 子樣本估出的截距與 z 斜率,同期 M2 與 M1 的 Brier 只差 −0.0004,這一段的改善與 regime 無關。這些分期差距都是描述數字,沒有做顯著性檢定。
可操作性
以靜態 SPY/GLD 各半為底,M2 警示(p̂ 超過歷史發生率兩倍)的隔日把 GLD 降到 25%:年化 Sharpe 差 0.013,HAC t 0.54,bootstrap p 0.6148。M1 疊加的曝險匹配回撤檢定,單尾 p 為 0.0328,但它不在事前主檢定內(H4 只針對 M2),曝險匹配差也只有 0.030%,不構成可交易的改善。
解讀與限制
- 全樣本裡,GVZ 斜率只在反向槓桿月份(黃金的常態)顯著,t = 3.47;但兩個 regime 的斜率差不顯著,樣本外也沒有轉成更好的預測。能下的結論是事前假說的方向沒有得到支持,還不能說預警力集中在哪一種 regime。
- 若要檢驗「槓桿方向決定 GVZ 意義」,需要能在多個年代觀察到 R=1 的資料。GLD 在 2017 年之後幾乎沒有 γ>0 的月份,改用黃金期貨把樣本拉長到 GLD 上市之前,或換到其他貴金屬,是比調參更有意義的下一步。
- 事件門檻、z 窗長、警示倍數都只測了事前指定的一組;regime 以 γ 的正負二分,未處理 γ 的估計不確定性;事件以收盤價路徑計,不含盤中回撤。
資料:Yahoo Finance(GLD、GVZ、SPY、^IRX),2010-06-01 至 2026-09-21。程式與事前登記:experiments/k1876/(README Part I 於首次執行前 commit)。非作者 Codex 審查第 2 輪 PASS。