← 研究動態
一般讀者2026/08/27 下午09:00

同一個深度學習模型跑五次,最好與最差差十五倍——你看到的是哪一次?

波動率預測深度學習模型評比空結果

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

一份模型績效報告上寫著一個數字。你會問資料期間、會問有沒有扣成本、會問是不是樣本內。

有一個問題大部分人不會問:這個模型總共跑了幾次,報上來的是哪一次。

先說這次量的是什麼

標普 500,一九六二年一月二日到二〇二六年七月二十九日,16,251 個交易日。預測的目標是市場的波動率,也就是「接下來這段時間會晃得多厲害」。

比的模型有六種:HAR、加了槓桿項的 HAR、AR(1)、嶺迴歸,以及兩種深度學習——LSTM 與 Transformer。三個預測期限:隔天、一週後、一個月後。

樣本外從一九七四年三月二十二日跑到二〇二六年六月二十六日,13,176 個交易日,中間重新配適十八次。成績用一個標準的誤差分數衡量,數字越小越好。

關鍵在這裡:兩種深度學習,每個設定都跑了 五次 。除了電腦內部的亂數起點不一樣,五次的資料、參數、程式碼完全相同。

五次的成績

同一個模型、同一批資料,只換一個亂數種子的五個成績

Transformer 在「一週後」這個期限上,五次的成績是:

第幾次誤差分數
最好那次波動率誤差 0.2842
第二波動率誤差 0.4630
第三波動率誤差 0.5336
第四波動率誤差 1.2191
最差那次波動率誤差 4.3134

最差是最好的十五倍。這中間沒有換資料、沒有換架構、沒有調參數。

「隔天」那個期限溫和一點,五次的波動率誤差從 0.4001 到 0.9749,最差還是最好的兩倍多。

拿來對照的是什麼

一個數字自己看不出大小。所以把它跟另一件事比: 如果不換種子,改成整個模型換掉,成績會差多少? 

同樣是「一週後」這個期限,六種模型的成績,最好的是加了槓桿項的 HAR,波動率誤差 0.1982;最差的是 AR(1),0.2934。整個模型家族從最土的線性模型到最新的深度學習,全部擠在這個區間裡。

換種子的落差,有時候比換模型還大

換種子造成的落差,是換模型造成的落差的四十二倍。

換句話說:如果有人告訴你「我們換了新架構,誤差降低了一成」,那個一成有可能整個落在「同一個模型多跑幾次」的自然散布裡面。他不是騙你,他只是沒跑第二次。

但不要把結論擴大成「AI 不穩」

這是這份資料裡我覺得最容易被寫錯的一段。

同一個實驗裡的 LSTM,三個期限、每個五次,最差跟最好的差距分別是百分之二、百分之三、百分之八。它很穩。Transformer 的十五倍也不是每個期限都出現,到了「一個月後」,它五次的差距縮到百分之八,跟 LSTM 一樣穩。

所以不穩定的不是「深度學習」這個類別,是 特定架構配上特定的訓練長度 。一週後那個期限的訓練樣本比隔天少、又比一個月的多,剛好卡在 Transformer 最容易發散的地方。

這代表你沒辦法從「它是不是 AI」預先判斷穩不穩,只能實際多跑幾次看。

平均之後,這件事會消失

五次跑完,通常的做法是把五次的預測平均起來當最終答案。

Transformer 在「一週後」的五次的波動率誤差平均是 1.3626——被那個 4.3134 拉得很高。但把五次的 預測值 先平均、再算誤差,得到的波動率誤差是 0.2659。

平均是有效的,它確實把那次失控吸收掉了大半。問題是,最後被寫進報告的就是 0.2659 這個數字。你從這個數字上完全看不出來,它背後有一次跑出了 4.3134。

這不是造假。這是集成的正常運作。但它同時意味著: 看不到逐次成績的時候,你無法判斷一個好數字是穩定的,還是被平均救回來的。 

五次都平均完,還是沒贏

把上面所有的救援手段都用上,五次平均、選最好的深度學習架構,結果是:三個期限沒有任何一個,讓深度學習的成績通過統計檢定贏過 HAR。

隔天,HAR 的波動率誤差是 0.3768,最好的深度學習是 0.3713,看起來領先,但檢定的結果是未達顯著。一週後與一個月後,深度學習連數字都輸。

同一份實驗的研究版報告已經發過,那篇問的是「有沒有一個夠長的期限讓深度學習翻身」,答案是沒有。這篇不重複那個結論,這篇問的是另一件事: 在得到那個結論之前,這些成績本身有多不可靠。 

你能拿去用的一句話

下次看到任何模型績效,不管是券商的、基金的、還是社群上貼的回測,多問一句:

 這個數字跑了幾次?逐次的成績能看嗎? 

如果對方只跑過一次,那個數字的可信度,就是本文開頭那張圖裡的任意一個點。它可能是 0.2842,也可能是 4.3134。


資料來源:本站「深度學習與 HAR 在三個預測期限上的對照」實驗,標普大盤日頻的全距波動率代理,一九六二至二〇二六年。本文所有數字機械抽取自實驗結果檔,抽取與核對腳本見 storage/drafts/k1814_seeds_20260827_evidence.py 與 storage/drafts/k1814_seeds_20260827_verify.py。需要說明的是,這份實驗用的是日頻的全距代理而不是五分鐘資料,免費資料源的五分鐘 bar 只回得到六十個交易日,撐不起一個月期限的樣本外測試。

懶人包圖組

概念卡:說明這次比較用標普大盤一九六二到二〇二六年的日資料,樣本外一萬三千多個交易日,兩種深度學習模型各跑五次

結果卡:Transformer 五次的誤差分數最好是零點二八、最差是四點三一,差了十五倍,中間沒有換資料也沒有調參數

對照卡:同一期限上六種模型的成績全距只有零點零九五,而只換亂數種子造成的落差是它的四十二倍

結論卡:五次的平均誤差是一點三六,但把五次預測先平均再算誤差只有零點二七;即使如此仍未贏過 HAR 基準

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
今晚八點半非農公布:台指期夜盤公布後那三十分鐘,過去九年多比平常的晚上動得兇多少?
今晚台灣時間八點半(美東早上八點半,夏令時間),美國公布非農就業數據。台指期的夜盤在這一刻前後,波動會比平常大多少、又能撐多久? 我們把過去的非農夜一個一個翻出來,量了公布後三個三十分鐘的窗。先講清楚:這是回看過去的描述,不是預測今晚的方向或大小,今晚這一次也沒有放進任何數字。 先講結論 公布後的第一個三十分鐘,台指期夜盤的波動明顯放大。 把公布前三十分鐘當分母,事件夜公布後的升幅,是對照夜同一時…
→
📄
銀行收緊放款時,債券 ETF 劇烈震盪會讓隔天股市更不安嗎?十九年資料:不必另設一道警報
美國聯準會每一季會問各大銀行:最近對企業放款,標準是放寬還是收緊?當回答「收緊」的銀行明顯多過「放寬」,市場常把它當成信用變緊的訊號。一個常見的延伸想法是:在這種時期,高收益債或貸款類 ETF 一旦出現劇烈震盪,隔天的股市就更容易跟著不安,所以要對債券 ETF 的動靜特別敏感,甚至提早減碼股票。 這篇回答的就是這個決策:銀行收緊放款的期間,要不要把債券 ETF 的單日劇烈波動,當成比平常更強的股市…
→
📄
美光一年漲了六倍,財報又大好:想追之前,先量三把尺
美光九月三十日美股收盤後交出財報。營收 542.3 億美元,市場預期 504.5 億美元,多出 7.5%;跟去年同一季比,營收是將近五倍。下一季的營收財測抓 600 億到 630 億美元,市場原本只預期 565.5 億美元。 十月一日美股開盤,十年期美債殖利率一度衝到 5.34%,股市早盤走弱。後來殖利率回落,晶片股帶頭反彈,美光收漲 3.03%,費城半導體指數漲 1.59%,美股大盤 ETF 只…
→