同一個深度學習模型跑五次,最好與最差差十五倍——你看到的是哪一次?
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
一份模型績效報告上寫著一個數字。你會問資料期間、會問有沒有扣成本、會問是不是樣本內。
有一個問題大部分人不會問:這個模型總共跑了幾次,報上來的是哪一次。
先說這次量的是什麼
標普 500,一九六二年一月二日到二〇二六年七月二十九日,16,251 個交易日。預測的目標是市場的波動率,也就是「接下來這段時間會晃得多厲害」。
比的模型有六種:HAR、加了槓桿項的 HAR、AR(1)、嶺迴歸,以及兩種深度學習——LSTM 與 Transformer。三個預測期限:隔天、一週後、一個月後。
樣本外從一九七四年三月二十二日跑到二〇二六年六月二十六日,13,176 個交易日,中間重新配適十八次。成績用一個標準的誤差分數衡量,數字越小越好。
關鍵在這裡:兩種深度學習,每個設定都跑了 五次 。除了電腦內部的亂數起點不一樣,五次的資料、參數、程式碼完全相同。
五次的成績

Transformer 在「一週後」這個期限上,五次的成績是:
| 第幾次 | 誤差分數 |
|---|---|
| 最好那次 | 波動率誤差 0.2842 |
| 第二 | 波動率誤差 0.4630 |
| 第三 | 波動率誤差 0.5336 |
| 第四 | 波動率誤差 1.2191 |
| 最差那次 | 波動率誤差 4.3134 |
最差是最好的十五倍。這中間沒有換資料、沒有換架構、沒有調參數。
「隔天」那個期限溫和一點,五次的波動率誤差從 0.4001 到 0.9749,最差還是最好的兩倍多。
拿來對照的是什麼
一個數字自己看不出大小。所以把它跟另一件事比: 如果不換種子,改成整個模型換掉,成績會差多少?
同樣是「一週後」這個期限,六種模型的成績,最好的是加了槓桿項的 HAR,波動率誤差 0.1982;最差的是 AR(1),0.2934。整個模型家族從最土的線性模型到最新的深度學習,全部擠在這個區間裡。

換種子造成的落差,是換模型造成的落差的四十二倍。
換句話說:如果有人告訴你「我們換了新架構,誤差降低了一成」,那個一成有可能整個落在「同一個模型多跑幾次」的自然散布裡面。他不是騙你,他只是沒跑第二次。
但不要把結論擴大成「AI 不穩」
這是這份資料裡我覺得最容易被寫錯的一段。
同一個實驗裡的 LSTM,三個期限、每個五次,最差跟最好的差距分別是百分之二、百分之三、百分之八。它很穩。Transformer 的十五倍也不是每個期限都出現,到了「一個月後」,它五次的差距縮到百分之八,跟 LSTM 一樣穩。
所以不穩定的不是「深度學習」這個類別,是 特定架構配上特定的訓練長度 。一週後那個期限的訓練樣本比隔天少、又比一個月的多,剛好卡在 Transformer 最容易發散的地方。
這代表你沒辦法從「它是不是 AI」預先判斷穩不穩,只能實際多跑幾次看。
平均之後,這件事會消失
五次跑完,通常的做法是把五次的預測平均起來當最終答案。
Transformer 在「一週後」的五次的波動率誤差平均是 1.3626——被那個 4.3134 拉得很高。但把五次的 預測值 先平均、再算誤差,得到的波動率誤差是 0.2659。
平均是有效的,它確實把那次失控吸收掉了大半。問題是,最後被寫進報告的就是 0.2659 這個數字。你從這個數字上完全看不出來,它背後有一次跑出了 4.3134。
這不是造假。這是集成的正常運作。但它同時意味著: 看不到逐次成績的時候,你無法判斷一個好數字是穩定的,還是被平均救回來的。
五次都平均完,還是沒贏
把上面所有的救援手段都用上,五次平均、選最好的深度學習架構,結果是:三個期限沒有任何一個,讓深度學習的成績通過統計檢定贏過 HAR。
隔天,HAR 的波動率誤差是 0.3768,最好的深度學習是 0.3713,看起來領先,但檢定的結果是未達顯著。一週後與一個月後,深度學習連數字都輸。
同一份實驗的研究版報告已經發過,那篇問的是「有沒有一個夠長的期限讓深度學習翻身」,答案是沒有。這篇不重複那個結論,這篇問的是另一件事: 在得到那個結論之前,這些成績本身有多不可靠。
你能拿去用的一句話
下次看到任何模型績效,不管是券商的、基金的、還是社群上貼的回測,多問一句:
這個數字跑了幾次?逐次的成績能看嗎?
如果對方只跑過一次,那個數字的可信度,就是本文開頭那張圖裡的任意一個點。它可能是 0.2842,也可能是 4.3134。
資料來源:本站「深度學習與 HAR 在三個預測期限上的對照」實驗,標普大盤日頻的全距波動率代理,一九六二至二〇二六年。本文所有數字機械抽取自實驗結果檔,抽取與核對腳本見 storage/drafts/k1814_seeds_20260827_evidence.py 與 storage/drafts/k1814_seeds_20260827_verify.py。需要說明的是,這份實驗用的是日頻的全距代理而不是五分鐘資料,免費資料源的五分鐘 bar 只回得到六十個交易日,撐不起一個月期限的樣本外測試。
懶人包圖組



