← 研究動態
一般讀者2026/07/27 下午02:00

AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

AI 圈的「時序基礎模型」搬進波動率擂台:老公式 HAR 沒被打下來

先講結論

Google 的 TimesFM、IBM 的 TTM 是這一兩年最熱的「時序基礎模型」(time-series foundation model,簡稱 TSFM)。它們主打的賣點跟 ChatGPT 很像:不用替你的資料重新訓練,把一段歷史丟進去,它就直接吐出未來的預測。我們把這套東西搬到波動率預測,跟一個用了十幾年的老公式 HAR 放在同一張評分表上,跨美股(SPY)、台股(0050)、台指期(TX)三個市場、近十年、超過七千個逐日預測,得到三個乾淨的結果:

  1.  直接裸用的 TSFM 全數落後 。不做任何調整,TimesFM 和 TTM 在三個市場的預測誤差都明顯輸給 HAR。
  2.  簡單校準或跟 HAR 組隊之後,它們追得上、但沒有超前 。經過一道事後校準,或跟 HAR 的預測做加權組合,這些含 AI 成分的模型在統計上就跟最佳模型分不出高下了。可是每個市場、以及三市場合起來,預測誤差最低的仍舊是老牌的 HAR-A。
  3.  加了 AI 之後,唯一被改寫的是 SPY,方向還是「弱一點的 HAR 重新入列」,而不是 AI 把 HAR 擠掉 。

一句話:時序基礎模型不是不能用,但它在波動率上的正確用法是「校準後當隊友」,裸著上場只會拖後腿;而且就算校準好了,它也還沒有給你比 HAR 更準的預測。

我們到底測了什麼

市面上大多數「AI 打敗傳統模型」的說法,做的是一場賽馬:找一個指標,看誰的數字最小,然後宣布冠軍。這種比法有個老問題,波動率預測的評分本身帶雜訊,今天贏 0.3% 的模型,換一段樣本可能就反超回去,冠軍頭銜站不住。

我們換了一個更嚴的問法。把候選模型全部丟進一個池子:老公式這邊有 HAR、HAR-A(多了一個非對稱項,讓大跌後的波動反應更快),AI 這邊有裸用的 TimesFM、TTM,還有它們校準後的版本、以及跟 HAR 做組合的版本。接著跑一個叫「模型信心集合」的程序,問的是: 哪些模型可以被統計證據排除掉?  留在集合裡的模型,意思是「沒有足夠證據說它比最佳的差」,落選的則是「有證據判定它確實比較差」。

這個框架的好處是它誠實。留在集合裡不等於贏,只等於「還沒被淘汰」;集合裡可能同時有好幾個模型,代表以現有樣本量根本分不出它們誰高誰低。把 AI 模型丟進來,我們真正想看的是兩件事:AI 進得了這個集合嗎?原本 HAR 家族的集合,會因為 AI 的加入而變動嗎?

結果一:裸用的 AI,輸在起跑線

先看最直接的數字。評分用的是波動率預測的標準誤差分數,數字越低代表預測越準。三個市場的一步預測結果如下(誤差分數,越低越好):

市場最佳模型 HAR-ATimesFM 裸用TimesFM 校準後
SPY(美股,n=2,519)0.36930.47980.3837
0050(台股,n=2,426)0.35810.43510.3625
台指期 TX(n=2,438)0.16000.18610.1654

裸用 TimesFM 那一欄,每個市場都比 HAR-A 高出一截。這不是四捨五入的差距,是實打實的落後。下面這張圖把三個市場、五個模型比 HAR-A 高出多少畫在一起,紅色和橘色(裸用的 TimesFM、TTM)在每一組都戳得老高,綠色和紫色(校準後、跟 HAR 組合)則貼著地板。

各模型誤差分數比最佳模型 HAR-A 高多少

裸用會輸,原因不難理解。基礎模型是拿海量、五花八門的時間序列預訓練出來的通才,它沒見過「波動率」這個特定物種的脾氣。波動率有幾個很硬的結構特徵:它的水準會隨市場體制整段整段地跳、它高度持續、大跌之後會噴出。HAR 這條老公式用昨天、上週、上月的已實現波動率做加權,剛好把持續性抓得死死的。通才模型直接套上來,水準和尺度都對不準,誤差自然大。

結果二:校準能救,但只救到「追平」

有意思的地方在後半段。我們對 AI 的原始預測做了一道很輕的手術:Mincer–Zarnowitz 校準,白話說就是用一條迴歸,把它系統性高估或低估的偏誤修掉。以 SPY 為例,TimesFM 的誤差分數從裸用的 0.4798 降到校準後的 0.3837,幾乎貼平 HAR 的 0.3840;台股和台指期也是同一個走勢。跟 HAR 直接做加權組合,效果類似。

校準後的模型,能不能進「信心集合」?答案是進得去。下面這張圖把九個模型在四欄(三個市場加上跨市場合併)的存活狀況攤開,綠色是留在集合裡,灰色是被淘汰:

哪些模型進了信心集合

裸用的 TimesFM、TTM 那兩列,四欄全灰,一個都沒活。校準版和組合版則大片轉綠。這代表加了校準或組隊之後,AI 成分的模型確實躋身「統計上分不出比最佳差」的行列。

問題是,進了集合不等於贏。把三個市場按日期先平均、再跑一次跨市場的信心集合(2,344 個共同交易日),存活下來的只剩兩個模型:HAR-A(誤差分數 0.2955)和 AI+HAR 的校準組合(0.3003)。兩者並存在集合裡,意思是分不出高下;而數字最小的那個,還是純血的 HAR-A。整份實驗跑下來,沒有任何一個含 AI 的模型,在任何一個市場,拿到「顯著比 HAR 更準」的成績。

加了 AI,HAR 的地盤動了嗎

最後一個問題,是把 AI 加進池子後,原本 base 模型的信心集合會不會改變。三個市場加跨市場,總共四個場景,只有 SPY 變了:SPY 原本單獨比較時,集合裡只有 HAR-A;加入 AI 候選後,集合擴成 HAR 和 HAR-A 兩個。

值得細看的是變動的方向。集合變大,是因為比較弱的那個 HAR 重新被納入,而不是 AI 把 HAR 踢出去。換句話說,AI 候選的加入,連讓評分程序更果斷都沒做到,反而讓判斷更保守了一點點。其餘三個場景,集合原封不動。

誠實的但書

這份結果有幾個限制,講清楚才對得起讀者。

第一,這是回溯式的模擬樣本外測試,不是真正的即時預測。TimesFM 和 TTM 都是後來才發布的模型,它們預訓練吃過的資料,是否包含了評估期裡等價的歷史模式,我們沒辦法完全稽核。輸入端沒有偷看未來,但權重裡記了什麼,是個黑盒。所以這個窗口只能叫「回溯式的模擬樣本外」,不能宣稱是即時實戰。

第二,信心集合是一個「未被拒絕」的集合,不是「證明相等」的集合。集合大小會受評分方式、波動率代理、重抽樣設定影響。留在裡面,永遠只代表現有樣本量還排除不掉它,不代表它跟最佳一樣好。

第三,SPY 和 0050 用的是日 OHLC 算出來的 Garman–Klass 波動代理,只有台指期 TX 用本機 5 分鐘高頻資料算的已實現波動。跨市場的量測品質本來就不一致。

帶走三句話

  • 時序基礎模型號稱免訓練即插即用,但在波動率上裸著用,三個市場全部輸給老公式 HAR。
  • 一道輕校準或跟 HAR 組隊,就能讓它們追平、擠進統計上分不出高下的信心集合,可是追平不是超前,誤差最低的仍是 HAR-A。
  • 「AI 一定比較強」在波動率這題上要打個問號。這批模型要派上用場,關鍵動作是先校準、再跟 HAR 這類對的老公式組隊;原封不動丟上場,只會比老方法更差。

 數據與方法 :市場 SPY、0050.TW、台指期 TX,評分期間 2016-07 至 2026-07,逐資產樣本 2,426 至 2,519 筆,跨市場共同交易日 2,344 筆。波動代理方面,SPY 與 0050 用 yfinance 日 OHLC 的 Garman–Klass variance,TX 用 TAIFEX 5 分鐘已實現波動。時序基礎模型的 checkpoint 為 google/timesfm-2.5-200m-pytorch(TimesFM 2.5, 200M)與 ibm-granite/granite-timeseries-ttm-r2(TTM),context=512。評分採 Patton (2011) 提出的標準波動率誤差分數,一步預測(隔日)。模型信心集合用 Hansen–Lunde–Nason(2011)的程序,重抽樣 5,000 次,顯著水準 0.10,隨機種子固定。

 延伸閱讀 :本平台先前的相關實驗已建立模型信心集合這套評分基礎設施,並多次顯示在公平資訊集下,複雜的機器學習模型通常難以顯著勝過 HAR 家族;本文把這條結論延伸到最新的基礎模型。跨市場推論則遵循「先按日期把同日多市場聚合、再做檢定」的正確做法,不把同一天的多個市場當成互相獨立的樣本。

 可復現 :完整程式、結果檔與圖表都存在平台的實驗資料夾,本文所有圖表數字均由結果檔直接讀值繪製,未經二次加工。

懶人包圖組

把時序基礎模型和老公式 HAR 放進同一個候選池,問誰會被統計程序淘汰

老公式 HAR 對上 AI 模型的裸用、校準與組合版,用 QLIKE 和信心集合評分

SPY 上 TimesFM 裸用明顯落後,校準後幾乎追平 HAR,最佳仍是 HAR-A

三市場合併後信心集合只剩 HAR-A 和 AI 加 HAR 組合,最低誤差仍是 HAR-A

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
HAR 波動預測的誤差往哪邊偏:六成交易日高估,平均誤差卻幾乎是零
波動預測圈流傳一種說法:模型在市場最亂的時候會被嚇到、把未來的波動估得太高;市場安靜下來之後,又會被慣壞、估得太低。如果這句話成立,等於是一個可以直接拿來用的校正規則,波動高的時候往下修,低的時候往上修。 拿 SPY 從 1993-02-01 到 2026-09-11 的日收盤資料檢查這句話,資料不支持。 怎麼檢查 HAR 是波動預測最常見的起手式:把「昨天」「上週」「上個月」三個時間尺度的已實現…
→
📄
甲骨文對 Blue Owl 發出不可抗力通知:AI 機房有三張帳單,這次響的是哪一張
九月二十四日,Bloomberg 報導甲骨文對新墨西哥州 Project Jupiter 機房的開發方發出不可抗力通知,收件的是 Blue Owl Capital 旗下的單位。這座園區是 Stargate 計畫的旗艦之一,設計容量 2.45GW,預定二〇二八年上線,電力要靠 Bloom Energy 的天然氣燃料電池。 依 TechCrunch 同日的轉述,這份通知讓甲骨文在機房趕不上二〇二八年時…
→
📄
低波動 ETF 和高貝塔 ETF 最近變得同進同退了嗎?預先註冊的檢定沒有找到證據
市場上有一種說法:防守型的低波動股票和進攻型的高貝塔股票,原本一個漲、一個跌,最近卻開始「同步走強」,兩者的關係進入了新階段。 我們把這個說法做成事先註冊的檢定,用 SPLV(低波動 ETF)和 SPHB(高貝塔 ETF)的日報酬,看扣掉大盤之後,兩者的相關有沒有出現結構性的移動。兩項檢定都沒有找到證據。 先講結論 沒有找到證據顯示相關出現新階段。 主配對 185 個月(2011 年 5 月至 2…
→