← 研究動態
研究2026/06/16 下午03:00

把 GARCH 改聰明反而更笨:3 種 STGARCH 在 SPY 上全輸給老派 GJR

GARCHSPY波動率風險管理模型比較美股

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

把 GARCH 改聰明反而更笨:3 種 STGARCH 在 SPY 上全輸給老派 GJR

做量化研究有個常見的誘惑:覺得舊模型太陽春,多加一層邏輯應該會更準。

這次我們直接拿 SPY 2005-2026 的日報酬資料測一個想法。把標準 GARCH 加上 smooth transition 機制,讓波動率可以依照「現在市場是什麼狀態」平滑切換不同係數。試了三種狀態判斷指標:VIX、絕對報酬、滯後波動率。樣本外 2023-01 到 2024-12 共 502 天。

2026-06-16 的 v2 重跑修正了三個實作問題:滯後波動率 transition variable 不再用 full-sample GJR、GARCH/GJR baseline 改成真正 t-1 資訊的一步預測、STGARCH OOS state propagation 改成用當期 forecast variance 傳遞。結論沒翻轉,但精確差距比初版小。

結果一張圖講完。

5 模型 QLIKE 樣本外比較

模型QLIKE比 GJR 差多少DM 比較
GJR-GARCH(1,1)0.5588—baseline
STGARCH-lagvol0.5870+5.05%GJR 勝(p=0.014)
STGARCH-VIX0.5882+5.26%GJR 勝(p=0.013)
GARCH(1,1)0.5890+5.40%GJR 勝(p=0.008)
STGARCH-|ret|0.5955+6.56%GJR 勝(p=0.001)

QLIKE 是波動率預測常用的 loss function,越低越準。GJR 仍是第一,三種 STGARCH 全敗,但 v2 後的差距是 5.05-6.56%,不是初版的 9-12%。

DM 顯著性檢定 — 所有候選模型都顯著輸給 GJR

DM 是 Diebold-Mariano 預測比較檢定。這裡用的是 conventional non-HAC 雙邊 DM;三個 STGARCH 都輸給 GJR,其中 |ret| 版本最弱(p=0.0014),VIX 與 lagvol 版本則落在 conventional 5% 顯著、但不是 Harvey |t|>3 等級。這點比初版寫得更保守,也更準確。

多估四個參數,買到什麼

STGARCH 加上 smooth transition function 之後,需要估計 transition 平滑度 γ、threshold 位置 c、兩個 regime 的 GARCH 係數。照這支程式的 free parameters 算,STGARCH 是 9 個,GJR 是 5 個,差 4 個。

照直覺,模型自由度越高、越靈活,應該能擬合得更細。v2 把 likelihood 常數補回同一尺度後,STGARCH-VIX 的樣本內 log-likelihood 確實高於 GJR;但搬到樣本外,多估出來的參數沒有換到預測精度,502 天的 QLIKE 仍高出 GJR 約 5-7%。

問題出在哪?GJR 用一個非常便宜的設計,就把美股波動率最關鍵的特性吃掉了:壞消息(負報酬)造成的波動率衝擊比好消息大。一個 dummy 變數,一個額外參數,就抓住了 leverage effect 八成的訊號。

STGARCH 想用 VIX 或滯後資訊重新捕捉「市場到底處於什麼狀態」,但 SPY 的波動率動態裡,超出 GJR 之外可以被模型化的部分太薄,平滑切換機制反而引入估計噪音。

QLIKE 天花板真的存在

過去三年我們在 SPY 上跑過大量 GARCH 系與日頻波動率模型:GJR、HAR-RV、加 VIX 的 GARCH-X、HEAVY、加跳躍項、加 EVT 尾部修正、regime 類模型。多數有效模型的 OOS QLIKE 都擠在很窄的區間;K431 v2 的三組 STGARCH 也只是落在 0.587-0.596,沒有把 GJR 的 0.5588 壓下去。

K431 v2 等於再多一筆證據:複雜化的邊際報酬在 SPY 已經很薄。想要再壓低 QLIKE,下一步不該只是繼續疊 GARCH 內部結構,而是換資料粒度或換 target,例如 5 分鐘已實現波動率、日內/隔夜分解、或更直接的 realized-measure 模型。

對交易與風控的具體意義

如果你的風險模型還在用 GARCH(1,1),升級成 GJR 仍有清楚的 OOS 改善:K431 v2 量到的 QLIKE 改善是 5.4%,conventional DM p=0.008。不過若採 Harvey |t|>3 的研究上架門檻,這一格還不算強證據。

如果你已經在用 GJR,看到論文或產品推銷 STGARCH、雙 regime GARCH、Markov-switching GARCH,這次的數字可以當參考:在 SPY 這種高度被研究的資產上,多估出來的參數沒有換回預測精度。

新模型想要被認真考慮,門檻不是「樣本內 log-likelihood 提高」,而是「樣本外 QLIKE 在獨立的兩年區間打贏 GJR、而且通過嚴格的 DM / Harvey / bootstrap 檢查」。K431 v2 的三種 STGARCH 全部沒過這個門檻。

研究失敗也是結果。把 GJR 仍守住 SPY 日頻 QLIKE 第一名的事實寫清楚,下次知道往哪邊找新訊號,不要在原地多估參數。


 數據來源 :SPY 日收盤資料 2005-01-04 到 2026-03-24,OOS 2023-01-01 到 2024-12-31 共 502 筆。v2 完整實驗腳本與 results JSON 在 experiments/k431/k431_stgarch_v2.py 與 experiments/k431/k431_stgarch_v2_results.json。

 K431 v2 結論 :STGARCH does NOT beat GJR. Best ST: STGARCH-lagvol diff=5.051%. QLIKE ceiling confirmed.

 2026-06-16 v2 更正 :初版引用的 STGARCH 數字受 lagvol transition lookahead、baseline forecast slice 不對稱、STGARCH state propagation 與 likelihood 尺度問題影響。v2 修正後,headline 結論不變,但 STGARCH 與 GJR 的差距從 9-12% 改為 5-7%,DM 強度也改為 conventional 5% 到 1% 等級。

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
銀行收緊放款時,債券 ETF 劇烈震盪會讓隔天股市更不安嗎?十九年資料:不必另設一道警報
美國聯準會每一季會問各大銀行:最近對企業放款,標準是放寬還是收緊?當回答「收緊」的銀行明顯多過「放寬」,市場常把它當成信用變緊的訊號。一個常見的延伸想法是:在這種時期,高收益債或貸款類 ETF 一旦出現劇烈震盪,隔天的股市就更容易跟著不安,所以要對債券 ETF 的動靜特別敏感,甚至提早減碼股票。 這篇回答的就是這個決策:銀行收緊放款的期間,要不要把債券 ETF 的單日劇烈波動,當成比平常更強的股市…
→
📄
K1378:VIX 長期成分讓 SPY 波動預測勝過 GJR-GARCH,這個優勢在疫情窗外更穩定
做風險控管或選擇權定價的人,常要在兩種日頻波動模型之間取捨:只用報酬本身的 GJR-GARCH,或在 GARCH 之外加一個由 VIX 驅動的長期成分。後者多了一個外部變數要維護,值不值得,要看它的預測優勢從哪裡來。如果優勢只來自 2020 年那種市場崩跌的少數日子,平常用它就只是多背一個依賴;如果優勢出現在一般日子,它才是日常可用的改進。 K1378 用 SPY 的樣本外一步預測回答這個問題:A…
→
📄
一日恐慌指數開盤報的當日變異,平均是 SPY 盤中實際的 1.56 倍:這個數字該怎麼讀
Cboe 從 2023-04-24 開始正式發布一日恐慌指數 VIX1D。它和大家熟悉的 VIX 是同一套算法,只是把預測期間從一個月縮成一個交易日,用當天到期的 S&P 500 選擇權價格,算出市場認為「今天會晃多大」。 這個指數很容易被當成當天的波動預報。這篇回答兩個問題:開盤時它報的數字,和 SPY 當天實際晃的幅度差多少?兩者的差距能不能告訴我們明天? 開盤報的,通常比實際大 我們拿 VI…
→