同一個模型,只換餵進去的資料:台指期日盤的預測誤差少了一成五
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
同一個模型,只換餵進去的資料:台指期日盤的預測誤差少了一成五
台指期的日盤從八點四十五開到一點四十五,五個小時。你想預測今天這五個小時會有多震盪, 手上有兩種資料可以用。
一種便宜:每天收盤後,期交所公告當日開高低收,你算一個日報酬平方,當成「昨天有多震」。 這是免費的,任何人都拿得到。
另一種貴:你自己收逐筆成交,把每天切成五分鐘一段,算出當日的已實現變異數。 這要一條資料線、一台機器、一個不會漏資料的收集程式,還有多年的歷史累積。
問題只有一個:貴的那條,換得到什麼?
兩個模型,其他條件全部鎖死
這個實驗把台指期日盤從二〇一二年一月二日到二〇二六年七月十六日、共 3550 個交易日的 自有逐筆資料拿來跑。模型只有一個,就是把「昨天、上週、上月」三個時間尺度的 波動當輸入去預測明天。這是波動率預測的業界基準線,不是什麼新東西。
關鍵在於它跑兩次:
- 五分鐘版 :三個輸入都用五分鐘的已實現變異數算。
- 日資料版 :三個輸入都用日內開盤到收盤的報酬平方算。
除了餵進去的資料不同,兩邊完全一樣,同樣的滾動視窗(1000 天)、同樣的重估頻率、 同樣的離譜值過濾規則、同樣的計分帳本。沒有任何一邊被調過參數。
預測的發動時點是每天早上八點四十五,日盤開盤前那一刻。所有輸入都往前推一天, 前一晚的夜盤在凌晨五點就結束,也在資訊集裡。這樣設計的用意是讓「拿得到的資訊」 和「真實交易當下拿得到的資訊」對齊,而不是事後回頭看。
結果
計分用的是波動率預測的標準誤差分數,越小越好;顯著性用的是預測比較的標準檢定, 負的檢定值代表五分鐘版的誤差比較低。
| 計分目標 | 期間 | 天數 | 五分鐘版 | 日資料版 | 改善 | 檢定值 | 判定 |
|---|---|---|---|---|---|---|---|
| 五分鐘已實現變異數 | 2016-01-20 起 | 2548 | 0.1909 | 0.2237 | 14.70% | -3.68 | 五分鐘版勝 |
| 五分鐘已實現變異數 | 2017-05-16 起 | 2231 | 0.1859 | 0.2157 | 13.81% | -3.07 | 五分鐘版勝 |
| 日報酬平方 | 2016-01-20 起 | 2536 | 1.3950 | 1.4437 | 3.37% | -3.37 | 五分鐘版勝 |
| 日報酬平方 | 2017-05-16 起 | 2222 | 1.3717 | 1.4196 | 3.37% | -2.92 | 未達門檻 |
第一行是主結果:在十年多、2548 個計分日上,同一個模型換成五分鐘資料,平均誤差分數 從 0.2237 降到 0.1909,少了 14.70%,這個差距出於偶然的機率是 0.00024。

那個「未達門檻」才是重點
如果只看第一行,故事很乾淨:逐筆資料有用,收。但這個實驗的判定規則是事前寫死的—— 兩個計分目標的檢定值絕對值都要超過三,才算穩健。第四行沒過。
為什麼會有兩個計分目標?因為沒有人看得到真正的波動率,它是潛在的。 五分鐘已實現變異數是一個代理,日報酬平方是另一個代理,兩個都有雜訊。 用五分鐘那個當計分目標時,五分鐘版天生沾光,它的輸入和計分尺是同一種東西做的。 所以要換一把不同來源的尺再量一次,而換了之後,優勢從一成五掉到百分之三點多, 在夜盤上線後的子樣本上,檢定值是 -2.92,差一點點。
誠實的結論是:逐筆資料在台指期日盤有正的邊際價值,方向在四個帳本上一致, 但幅度取決於你用哪把尺量,而且在其中一個帳本的子樣本上沒有跨過事前定好的門檻。 不是「碾壓」,是「穩定地贏一點,而那一點在某些量法下小到檢定抓不住」。

兩個容易被跳過的細節
一、目標合約的選擇本身可能偷看未來。 原始程式用「當日總量最大」挑活躍月合約, 而當日總量包含了要被預測的那個日盤。這是評審抓出來的阻斷性缺陷。修法是另外寫一條 事前規則:持有近月合約到公告的最後結算日再轉倉,輸入只有前一天持有的合約和結算日曆, 兩者在八點四十五都已知。這條事前規則在樣本外重現了實際選擇的 99.80%, 剩下五天被剔除後重跑,判定不變。
二、便宜那一邊沒有真的從外部日資料抓。 日資料版的日報酬是從同一份逐筆資料 壓出來的。它的資訊集是日頻沒錯,但這個實驗沒有證明「訂一份免費的日結算檔就能取代 整條逐筆管線」,只證明了「五分鐘資訊贏過被壓成日頻的資訊」。差別在於, 外部日資料還有它自己的口徑與延遲問題,那是另一個實驗。
另外,五分鐘版有 0.27% 的預測被離譜值過濾器攔下來換成樣本內均值,日資料版是零。 這是逐筆資料的代價之一:解析度高,偶爾也會吐出奇怪的數字。
所以要不要自己收 tick
如果你的用途是「知道今天大概會不會震」,例如決定要不要縮部位、要不要把停損放寬—— 這個實驗說日資料版本已經抓得到大部分方向,逐筆資料買到的是誤差再少一成左右。 要不要為這一成付出一條資料線和長期維運,看你的部位規模乘上這一成值多少錢。
如果你的用途是盤中報價、造市或短線的變異數交易,那這篇沒有回答你的問題—— 這個實驗只測日盤、只測隔日一步、只測日盤的波動,夜盤和選擇權逐筆都不在裡面。
值得記住的是另一件更一般的事:這個實驗最有價值的部分不是那個 14.70%, 而是它同時跑了第二把尺,並且在第二把尺上誠實地報告「差一點點」。 只用一把尺量自己的模型,量出來的數字幾乎一定比較好看,因為那把尺是你自己選的。
資料與方法 :台指期自有逐筆資料,日盤 08:45-13:45,2012-01-02 至 2026-07-16, 共 3550 個交易日;滾動視窗 1000 天,每個發動點重估。完整結果、排除規則與評審意見見 本站的實驗目錄(已通過獨立審查認證)。漲停鎖死導致當日波動為零的兩天 (誤差分數在真值為零時無定義)與日報酬恰為零的日子已依事前規則排除,計入表中天數差異。
懶人包圖組




相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊