← 研究動態
研究2026/06/16 下午11:00

風險模型不是愈高級愈安全:最土的方法反而最少踩線

SPY風險管理歷史模擬極端風險分配假設

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

風險模型不是愈高級愈安全:最土的方法反而最少踩線

做風控的人很容易有一個直覺:模型愈進階,尾巴抓得愈胖,應該就愈安全。

這次實驗給了一個不太討喜但很實用的答案。拿同一套底層波動模型,去配四種不同的尾端估法後,真正最不容易踩到 1% 風險線的,不是看起來比較高級的 Student-t,而是最樸素的 Historical Simulation(簡稱 HistSim),以及和它打平的「直接估分位」。

這次測的是 SPY,樣本外期間是 2023-01-01 到 2024-12-31,共 502 個交易日。你可以把它想成一個簡單問題:

如果市場最糟的那 1% 日子真的來了,哪個方法最不容易把風險估太淺?

先看最重要的一張圖

1% 風險線回測違反次數

理論上,502 個交易日裡,這條 1% 風險線大概該被擊穿 5 次左右。

實際結果是:

方法違反次數違反率
Normal101.99%
Student-t81.59%
直接估分位40.80%
HistSim40.80%

這張表的重點在順序,不在小數點。

Normal 最差,Student-t 有進步,但還是偏多。真正把違反次數壓到最穩的是「直接估分位」和 HistSim,兩者 並列贏家 ,違反次數都只有 4 次。

奇怪的是,精度分數幾乎沒差

更反直覺的地方在這裡。

同樣四個方法去比平均表現分數,幾乎打成平手。

四種方法的平均分數幾乎打平

四者最大差距只有 0.00000359。換句話說:

  • 你若只看平均分數,會覺得四種方法差不多
  • 但你一旦看 1% 尾端回測,差別立刻拉開

這正是這篇最值得記的一句話:

尾端怎麼估,不太改變平均分數,卻會直接改變你在最壞日子的失手次數。

順帶一提,這次跑了正式的 Diebold-Mariano 檢定比較四個方法的平均分數,所有兩兩差距的 p 值都不到顯著。換成白話: 就「平均分數」這個指標而言,四個方法統計上分不出勝負 。真正分勝負的,是「最壞那幾天」的尾端違反次數。

為什麼會這樣

因為這四個方法吃的是同一個波動率底盤。前面的模型已經先把「明天大概有多晃」估出來了,後面真正分勝負的,是你怎麼把這個波動率轉成最壞情況的保守邊界。

Normal 的問題是尾巴太薄,市場真的摔深一點時,它容易低估風險。

Student-t 確實比 Normal 厚尾,所以從 10 次違反降到 8 次,這步方向是對的。但它還是在用一個固定分配去描述尾巴,彈性有限。

HistSim 則是乾脆不先假設分配長什麼樣,而是直接拿歷史殘差的經驗分位數來估。市場尾巴如果本來就歪、就厚,它比較容易原樣保留下來。

所以這篇不是在說 Student-t 沒用,而是在說:

 當你真的在乎「最壞那幾天會不會估太淺」,分配假設本身比平均精度更重要。 

對一般讀者最實用的翻譯

如果你把風險模型當成煞車系統,平均手感分數比較像平常開車時的順不順;1% 風險線的違反次數,比較像真正急煞那幾次有沒有煞住。

平常手感差不多,不代表急煞表現也差不多。

這次的結果就是:

  • 平均手感四台車差不多
  • 真正急煞時,HistSim 和「直接估分位」並列最穩
  • Normal 最容易煞不住

如果你真的要選一個做法

這份實驗給的實務排序很直白。

第一線並列的是 HistSim 和「直接估分位」。兩者在 1% 風險線都只違反 4 次,尾端回測一樣乾淨。如果你只能挑一個無假設、容易解釋的做法,HistSim 是直覺首選。

第二層是 Student-t。它比 Normal 好,但還不夠好到讓你放心。

最不該偷懶的,是直接用 Normal。在這組 SPY 樣本裡,它把最糟情況低估得最明顯。

給技術讀者的兩個揭露

第一,HistSim 在這次實驗裡是 每天 用最新的歷史殘差重算一次經驗分位數;Student-t 的自由度和迴歸式的分位數模型則是 每 63 個交易日 才重估一次。沒有看到未來的資料(time-of-day 對齊都是 t-1 為止),但 HistSim 等於享有比較頻繁的局部更新節奏,這個操作差異會給它一些優勢。比較公平的進階測法是讓所有方法用一樣的更新頻率,這留給後續實驗。

第二,這次用的「綠黃紅」燈號是依違反率簡單切的內部規則,跟 Basel 250 天計次規則不完全相同。若要做監管合規報告,建議改用官方計次門檻而非本文的簡化版。

這篇結論只有一句

風險管理裡,真正讓你出事的是最壞那幾天低估太多,平均分數輸一點反而其次。這次實驗告訴我們,這件事上最土的 HistSim 反而和「直接估分位」並列贏家,比看起來更高級的 Student-t 更耐尾端。

本文基於站內 SPY 風險估計實驗(K824)。數據來源:yfinance SPY,樣本外期間 2023-01-01 至 2024-12-31,共 502 個交易日。經 Codex source-code review,CONDITIONAL_PASS。

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
VIX 越高、衝擊越被「吸收」?比例式衝擊倍數的分母陷阱與門檻效應
VIX 已經很高時,再來一次 VIX 大跳,SPY 的反應會不會變小?常見的量法是「衝擊倍數」(shock amplification ratio,SAR):衝擊日的 |r| 除以平日的 |r|。這個倍數確實隨前一日 VIX 升高而下降,於是很容易讀成「高波動環境會吸收衝擊」。本文檢驗這個讀法在三個地方站不站得住:分母、門檻,以及外生衝擊。 資料是 SPY 與 VIX 日資料,2006-01-05…
→
📄
VIX 已經很高時再跳一次,SPY 多晃的幅度沒有變小——危機時還更大
你是否會在 VIX 已經很高的時候降低對「下一次 VIX 大跳」的防備,理由是市場已經怕過了,再一次衝擊不會多晃太多?這份資料的答案是不會少晃:VIX 一天跳升兩點以上的那天,SPY 的單日漲跌幅比平日多出約一個百分點,不論前一天 VIX 在十幾還是二十幾都差不多;VIX 在 30 以上的危機期間,多出來的幅度還更大。 我們看了什麼 資料是 SPY 與 VIX 的日資料,期間 2006-01-05…
→
📄
K1884:拿 VIX1D 對照 SPY 同一天的已實現變異,年化分母、報價時點與盤中窗口各自能把答案改掉多少
一般讀者版〈一日恐慌指數開盤報的當日變異,平均是 SPY 盤中實際的 1.56 倍:這個數字該怎麼讀〉給的是水準與讀法。這篇處理做這個比較時要先決定的三件事:VIX1D 要除以哪一個年化分母、要拿哪一個時點的報價、已實現變異要涵蓋盤中哪一段。 K1884 的結果顯示,這三個選擇造成的偏移,與要量的效果同一個量級;選錯任何一個,程式不會報錯,只會回答另一個問題。 先釐清估計量。K1884 量的是同一…
→