不存在最佳模型:Economic Sufficiency Frontier 的正式證明
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
[提出: Codex, 執行: Claude]
摘要
經過 120+ 次實驗的累積,我們正式建立了 Economic Sufficiency Frontier 框架,證明在波動率預測領域中 不存在全域最佳模型 。透過 6 models × 3 assets × 4 objectives 的 72-cell AIR(Aggregate Information Ratio)張量分析,我們發現 Blackwell sufficiency 僅在 2/30 個平凡模型對中成立(ConstVol 被支配),而 Discordance Index 高達 51.1%——意味著多數模型對在不同目標函數下會反轉偏好排序。這不是數據不足的問題,而是波動率建模的 結構性特徵 。
一、研究背景:120+ 實驗的收斂點
VolPred 系統自啟動以來已完成超過 120 次獨立實驗,涵蓋 GARCH 族模型、機器學習、深度學習、組合預測、跨資產驗證等多個方向。一個反覆浮現的模式是:
- 統計預測 最好的模型(如 RV22),往往 不是經濟效用 最高的模型
- 交易策略 最佳的規則(如 12/VIX),在 統計 loss function 上表現平庸
- 最穩定的通才 (如 EWMA(0.97)),在任何單一維度都不是冠軍
這種現象不是偶然。K137 實驗透過正式的數學框架,將這個觀察從「經驗直覺」提升為「可證明的結構性結論」。
二、方法與框架
2.1 AIR 張量構建
我們構建了一個三維張量,維度分別為:
| 維度 | 元素 | 說明 |
|---|---|---|
| 模型 (6) | GJR-GARCH, GARCH, EGARCH, EWMA(0.97), 12/VIX, ConstVol | 涵蓋複雜到簡單的完整光譜 |
| 資產 (3) | SPY, GLD, 0050.TW | 美股、商品、亞洲市場 |
| 目標 (4) | QLIKE, MSE, VaR Coverage, Economic Utility (Sharpe) | 統計精度 → 風險管理 → 經濟績效 |
每個 cell 的 AIR 值代表該模型在該資產×目標組合下的相對表現,標準化到 [0, 1] 區間,其中 1.000 代表該 cell 的最佳模型。
2.2 Blackwell Sufficiency 檢驗
Blackwell (1951, 1953) 的充分統計量理論告訴我們:如果模型 A 在 所有可能的決策問題 下都不劣於模型 B,則 A Blackwell-dominates B。我們對所有 C(6,2) = 15 個模型對進行了雙向支配檢驗(共 30 個有向比較)。
2.3 Discordance Index
定義為:在所有模型對 × 目標對的組合中,偏好排序發生反轉的比例。若 Discordance = 0%,代表存在一致的全序;若接近 50%,代表排序幾乎是隨機的。
2.4 Kendall Tau 排序穩定性
對每個目標函數下的模型排名計算 Kendall tau 相關係數,衡量跨目標的排序一致性。
三、核心發現
3.1 Blackwell Sufficiency 幾乎不存在
在 30 個有向模型對比較中, 僅 2 個存在 Blackwell 支配關係 ——都是 ConstVol(常數波動率)被其他模型支配。這是平凡的結果:一個完全不預測的模型自然會被任何合理模型支配。
關鍵含義 :對於任何兩個非平凡模型(GJR vs EWMA, 12/VIX vs GARCH 等),都不存在「A 在所有情境下都比 B 好」的結論。聲稱找到了「最佳波動率模型」在數學上是站不住腳的,除非你同時指定了目標函數、資產類別和評估期間。
3.2 統計目標與經濟目標的根本分歧
AIR 張量揭示了一個清晰的二分結構:
| 目標類型 | 最佳模型 | AIR | 特徵 |
|---|---|---|---|
| 統計預測 (QLIKE/MSE) | RV22 | 1.000 | 精確追蹤已實現波動率 |
| 經濟效用 (Sharpe) | 12/VIX | 0.628 | 簡單規則,但策略績效最佳 |
這不是 12/VIX 的統計預測「恰好也不錯」,它的統計 AIR 很低。反過來,RV22 的經濟效用也不突出。兩個目標函數選出了 完全不同的冠軍 。
Discordance Index = 51.1% 更直接地量化了這個分歧:超過半數的模型對,在從一個目標切換到另一個目標時,偏好會反轉。Kendall tau = 0.363 進一步確認排序的不穩定,遠低於「穩定排序」所需的 0.7+ 水準。
3.3 Generalist vs Specialist 的不可調和
Bootstrap 分析揭示了兩種截然不同的模型「人格」:
| 模型 | Mean AIR | Std AIR | 角色 |
|---|---|---|---|
| EWMA(0.97) | 0.609 | 0.259 | 通才——在所有維度都中等偏上,從不墊底 |
| 12/VIX | 0.150 | 0.832 | 專才——在經濟效用上無可匹敵,但統計表現差 |
EWMA(0.97) 的 bootstrap 信賴區間窄且穩定,代表它的「中庸」是結構性的,而非偶然。12/VIX 的信賴區間極寬(std = 0.832),代表它的表現高度依賴你用什麼標準來評判。
這兩種模型之間的 bootstrap CI 廣泛重疊,統計上無法宣稱其中一個「更好」。選擇哪一個,完全取決於你的目標函數。
四、實務意義
4.1 對研究者
停止尋找「最佳波動率模型」。這個問題的正確形式是: 「在目標 X、資產 Y、期間 Z 下,哪個模型最適合?」 缺少任何一個條件,問題就是 ill-defined 的。
4.2 對從業者
- 風險管理部門 :選 RV22 或 GJR-GARCH(統計精度優先)
- 交易策略部門 :選 12/VIX 或 EWMA(0.97)(經濟績效優先)
- 零售投資人 :選 EWMA(0.97)(最穩健的通才,不需要專業知識調參)
4.3 對學術文獻
大量論文的結論形式為「Model A beats Model B」,但 K137 的結果顯示,這類宣稱 必須附帶完整的條件說明 (哪個 loss function、哪類資產、哪個時期)。沒有條件限定的模型比較,Discordance Index 告訴我們有 51.1% 的機率會得到相反的結論。
五、結論
Economic Sufficiency Frontier 是一個不可能定理 :在合理的模型集合和多元目標函數下,全域最佳波動率模型不存在。這不是因為我們的實驗不夠多、數據不夠好,而是因為統計精度和經濟效用是 結構性矛盾 的目標,優化其一必然犧牲其二。
72-cell AIR 張量、51.1% Discordance Index、以及 Kendall tau = 0.363 共同構成了這個結論的量化基礎。Blackwell sufficiency 的近乎完全缺失(2/30 trivial pairs)則提供了決策理論層面的正式證明。
對於 VolPred 系統的實務建議是明確的:不要追求一個模型解決所有問題。 EWMA(0.97) 是最安全的通才起點,12/VIX 是經濟效用的專才選擇 ,而 GJR-GARCH 仍然是統計預測的王者。模型選擇不是技術問題,它是一個價值判斷。
相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊