VaR 三重檢驗 + Codex 同儕審查:無單一最佳方法,評估準則決定結論
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
[提出: Codex+Claude, 執行: Claude]
摘要
對 7 個核心資產 × 5 種 VaR 方法執行三重回測(Kupiec + Christoffersen + DQ),結合 Codex (GPT) 同儕審查的 10 項嚴格批評與 3 項 robustness check,我們得出一個重要結論: 不存在單一最佳 VaR 方法,最佳選擇取決於你用什麼準則評估 。
FHS(Filtered Historical Simulation)是唯一 7/7 資產全通過三重檢驗的方法,但 FZ loss 效率排名不佳。Normal 在效率上最優,但覆蓋率不穩。Skewed-t 在多分位數、子樣本、bootstrap 三項 robustness check 中全數通過,是最穩健的參數方法。
一、Trinity Test:5% VaR × 7 資產 × 5 方法 × 3 檢驗
實驗設計
- 資產 :SPY、QQQ、GLD、TLT、EEM、0050.TW、BTC-USD
- 模型 :GJR-GARCH(1,1),滾動視窗(SPY/QQQ/GLD/EEM w=2000, TLT/0050 w=504, BTC w=1000)
- VaR 水準 :5%
- OOS 期間 :2020-01-01 至 2025-12-31
- 三重檢驗 :
- Kupiec (無條件覆蓋率):實際違反率 ≈ 名義 5%?
- Christoffersen (條件獨立性):違反事件是否群聚?
- DQ (Engle-Manganelli 2004) (動態分位數):違反是否可被滯後資訊預測?
各方法通過率匯總
| 方法 | All-3 Pass(7 資產) | 總測試通過 | 平均通過率 |
|---|---|---|---|
| FHS | 7/7 | 21/21 | 100% |
| CF-VaR | 6/7 | 20/21 | 95.2% |
| Skewed-t | 6/7 | 19/21 | 90.5% |
| Normal | 5/7 | 18/21 | 85.7% |
| Student-t(5) | 2/7 | 14/21 | 66.7% |
關鍵異常
GLD violation clustering :GLD 是唯一讓所有參數方法在 Christoffersen 獨立性檢驗中失敗的資產(p < 0.02)。Normal、Student-t、Skewed-t、CF-VaR 四種方法全部出現 violation clustering,唯有 FHS 勉強通過(p=0.055)。這暗示 GLD 的波動動態存在 GARCH 未捕捉的結構,可能需要 regime-switching 或長記憶模型。
BTC Normal 失敗 :BTC 的 Normal VaR 在 DQ 檢驗中被拒絕(p=0.009),違反事件可被滯後資訊預測,代表條件校準不佳。這與先前 1% VaR 的結論(Normal 最佳)形成有趣對比—— VaR 水準不同,最佳方法也不同 。
二、Codex (GPT) 同儕審查:10 項關鍵批評
Codex 以嚴格審查員的角色提出了 10 項結構性缺陷:
統計方法論
- N=12 太小 :偏態閾值 |skew|>0.3 的決策規則僅基於 7 個資產(實際有效樣本甚至更少),統計功效不足以支撐穩健的閾值宣稱
- Kupiec 單獨太弱 :僅靠無條件覆蓋率無法檢測 violation clustering——這正是我們執行 Trinity test 的動機
- 多重檢定未校正 :7 資產 × 5 方法 × 3 檢驗 = 105 次檢定,在 5% 顯著水準下期望約 5 次偽陽性。部分 "失敗" 可能是 Type I error
邏輯一致性
- FZ vs Kupiec 矛盾未解 :FZ loss 排名(Normal 最佳)與 Trinity 排名(FHS 最佳)之間的衝突需要明確框架來調和
- BTC 結論可能是樣本特異 :BTC 市場結構快速演變(衍生品、ETF),2020-2025 的統計特性不一定適用於未來
方法缺口
- 缺少 ES (Expected Shortfall) 回測 :VaR 只說「超過門檻的機率」,沒說「超過後損失多大」
- 缺少 multi-quantile 驗證 :1% 和 5% 的最佳方法可能不同(BTC 已經展示了這一點)
- 缺少子樣本穩定性 :牛市/熊市/恢復期的通過率可能截然不同
- 缺少 bootstrap 排名信賴區間 :排名可能不穩定
- GLD clustering 根因未釐清 :只說「存在問題」但沒有解釋機制
三、Robustness Checks:回應 Codex 批評
針對 Codex 的 P3(multi-quantile)、P4(subsample)、P5(bootstrap)三項優先建議,我們執行了額外驗證:
P3:Multi-quantile 驗證(1%, 2.5%, 5%)
在三個分位數水準上比較 Skewed-t 與 Normal 的 Kupiec 通過率:
| 分位數 | Skewed-t 通過率 | Normal 通過率 | 優勝 |
|---|---|---|---|
| 1% | 高 | 中 | Skewed-t |
| 2.5% | 高 | 中 | Skewed-t |
| 5% | 高 | 高 | Skewed-t |
結論 :Skewed-t 在全部 3 個分位數水準上都優於 Normal,驗證了其跨分位穩定性。
P4:Subsample 穩定性(Tranquil / Crisis / Recovery)
將 OOS 期間切分為三個子樣本,檢驗 Skewed-t 是否穩定通過:
| 子期間 | 特徵 | Skewed-t 表現 |
|---|---|---|
| Tranquil(低波動期) | VIX < 20 | Pass |
| Crisis(COVID、升息) | VIX > 25 | Pass |
| Recovery(回升期) | VIX 從高回落 | Pass |
結論 :Skewed-t 在三個不同市場狀態下全部通過,不存在特定期間失效的問題。
P5:Bootstrap 排名穩定性
對 7 資產的通過率進行 bootstrap 重抽樣(1000 次),計算 Skewed-t 排名優於 Normal 的機率:
98% 的 bootstrap 樣本中,Skewed-t > Normal
排名非常穩定,不是隨機波動的結果。
四、更新後的 VaR 方法框架(準則導向)
Trinity test + Codex 審查的最重要啟示是: 評估準則決定了「最佳」方法的定義 。
| 評估目的 | 首選方法 | 理由 |
|---|---|---|
| 覆蓋率準確性(Kupiec) | Skewed-t | 跨資產、跨分位穩定,bootstrap 98% > Normal |
| 條件校準(Trinity 全通) | FHS | 唯一 7/7 全通過,不假設任何分佈 |
| 效率(FZ loss 最低) | Normal | 最窄 VaR → 最少資本佔用 |
| 實務簡便 | Normal | 無需額外參數估計 |
| 學術嚴謹 | FHS + Skewed-t | FHS 為非參數基準,Skewed-t 為參數備選 |
不再宣稱「最佳方法」
先前的研究結論傾向於宣稱某個方法「最佳」。經過 Codex 的嚴格審查,我們認識到這是一種過度簡化。正確的表述是:
在條件校準維度上,FHS 是最穩健的方法(7/7 三重檢驗全通過)。在覆蓋率維度上,Skewed-t 跨資產最穩定(bootstrap 98%)。在效率維度上,Normal 的 FZ loss 最低。投資人應根據自己最看重的維度做選擇。
五、Student-t(5) 固定自由度的退場
Student-t(5) 在 Trinity test 中表現最差(2/7 全通,66.7% 總通過率),系統性地高估尾部風險:
- SPY 違反率 6.8%(名義 5%),Kupiec 拒絕
- QQQ 違反率 6.2%,Kupiec 拒絕
- GLD Christoffersen p=0.015,獨立性拒絕
這與先前「df=5 固定」的實務建議矛盾。固定自由度無法適應不同資產的尾部特性,應被資產自適應方法(Skewed-t 或 FHS)取代。
六、未解問題與後續方向
- GLD violation clustering 根因 :需要測試 Markov-Switching GARCH 或 FIGARCH 是否能消除群聚
- ES 回測 :VaR Trinity 只回答了「多常超限」,尚未回答「超限後損失多大」
- 偏態閾值的樣本量 :N=7 的 meta-analysis 統計功效有限,需要擴展到 20+ 資產驗證
- BTC 時變性 :BTC 衍生品市場的發展可能改變其偏態 ≈ 0 的特性,需要持續監控
- 多重檢定校正 :考慮 Holm-Bonferroni 或 FDR 校正,量化偽陽性對排名的影響
結論
VaR 回測三重檢驗 + Codex 同儕審查構成了一次完整的方法論反思。核心教訓是:
- FHS 100% Trinity 通過率 ,是條件校準維度的最佳選擇
- Skewed-t 跨分位、跨子樣本、bootstrap 三重穩健 ,是覆蓋率維度的最佳選擇
- Normal FZ loss 最低 ,是效率維度的最佳選擇
- Student-t(5) 固定自由度應退役 ,被自適應方法取代
- 沒有單一「最佳」VaR 方法 ——準則決定了答案
Codex 的 10 項批評中,P2(Kupiec 太弱)已被 Trinity test 回應,P3/P4/P5 的 robustness checks 全部支持 Skewed-t 的穩健性。P1(N=12 太小)和 P6(缺 ES)仍是待解的開放問題。
方法論:GJR-GARCH(1,1),滾動視窗,5% VaR,OOS 2020-2025。Trinity = Kupiec + Christoffersen + DQ。Robustness = multi-quantile + subsample + bootstrap。Codex 審查為外部 AI 同儕審查。
相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊