「這個模型比較差」只在其中一段歷史成立:比特幣十一年切成三段之後,結論就散了
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
本站先前一份實驗下了一個乾脆的結論:一個號稱能自動調整反應速度的進階波動率模型,在預測比特幣的波動這件事上,輸給了一個一九九○年代就有的老派模型。那次的評分期間是二○二一年一月到二○二六年四月,共 1926 天,模型用一段一段往前滾的 1500 天視窗估計,差距在統計上算明顯,強度 -4.578。
這種結論很好用,因為它省事:既然新的沒有比較好,那就不用管它了。
這次要確認的是這句話能不能單獨拿出來用。做法很單純:同樣一份資料、同一組模型,但不再看全部歷史,而是把比特幣的十一年切成三段各自跑一次。
資料是比特幣兌美元的日資料,從二○一五年一月到二○二六年四月,共 4121 個交易日。三段的切法不是把資料等分,是照市場結構切:法人進場前(二○一五到二○二○)、Luna 與 FTX 連環爆的那幾年(二○二一到二○二三)、現貨指數基金上市之後(二○二四到二○二六)。每一段各自估計、各自預測,不共用前一段的結果。
結果:那個結論只在第一段成立

第一段,實際拿來評分的有 1441 天,強度 -4.669。進階模型確實明顯較差,這一格站得住。
第二段,345 天,強度 -0.815。
第三段,100 天,強度 -0.803。
後面兩段連常用的判斷門檻都碰不到。
這裡要精確一點,因為兩次比的其實不是同一段日子。
先前那次評的是二○二一年一月到二○二六年四月,1926 天,模型用滾動 1500 天視窗估計。這次每一段各自估、各自評,而每段都要先燒掉 750 天當初始視窗,所以第一段實際評分的期間是二○一七年一月下旬到二○二○年底—— 那正是先前那次完全沒有評到的期間 。反過來,在先前那次涵蓋的二○二一年之後,這次只評到 345 天(二○二三年)與 100 天(二○二六年前四個月),合計 445 天。
把兩件事併起來說才誠實:明顯的差距出現在一段先前沒被評過的舊日子;而在先前有評過的那幾年裡,這次能重測到的那 445 天看不出差別。所以那句結論綁定的是特定的市場條件與特定的估計方式, 不是比特幣這個資產的普遍性質 。這也是原始結果檔自己下的判語:集中在單一體制,而非普遍屬性。順帶一提,先前那次的結果在它自己的穩定性檢查上也沒有通過。
預測誤差本身的差距也是同一個形狀:

用一個標準的預測誤差指標來看(數字越小越好),第一段老派模型是 1.9926、進階模型是 2.1904,後者差了 9.92%。第二段是 2.2891 對 2.3162,只差 1.18%。第三段是 1.9753 對 2.0563,差 4.10%,但那一段只有 100 天,這個數字本身也不穩。
三段放在一起看:
| 期間(估計用) | 實際評分區間 | 天數 | 老派模型誤差 | 進階模型誤差 | 兩者差距 | 統計強度 |
|---|---|---|---|---|---|---|
| 2015-2020 法人進場前 | 2017-01-21 至 2020-12-31 | 1441 | 1.9926 | 2.1904 | 9.92% | -4.669 |
| 2021-2023 Luna 與 FTX | 2023-01-21 至 2023-12-31 | 345 | 2.2891 | 2.3162 | 1.18% | -0.815 |
| 2024-2026 現貨指數基金之後 | 2026-01-05 至 2026-04-14 | 100 | 1.9753 | 2.0563 | 4.10% | -0.803 |
順帶一提第三段還有個小反轉:那 100 天裡誤差最低的是老派模型的厚尾版本(1.9484),不是被拿來當基準的原版(1.9753)。差距同樣沒有通過檢定,寫出來只是提醒:在這種樣本長度下,前三名的順序本來就會晃。
另一半的答案:三段都說「一個狀態不夠」
這次還做了第二件事:不預先切期間,改成讓模型自己去找市場有沒有在兩種狀態之間切換,然後問「兩個狀態的版本有沒有比單一狀態的版本更貼合資料」。
三段的答案一致,而且都不含糊。第一段的檢定統計量是 48.53,第二段 36.63,第三段 15.91——連樣本最短的第三段,出於偶然的機率也只有 0.0142。
這兩件事合起來才是重點。 同一份資料,「哪個模型比較好」的答案會隨期間變;「市場有沒有在切換狀態」的答案不會變。 前者是脆的,後者是穩的。
這篇沒有證明的事
第二段實際評分的只有 345 天,第三段只有 100 天。本站的研究程序要求至少 252 天才算能做可靠推論,所以第三段在原始結果檔裡就被標成初步。後面兩段的「沒有明顯差別」,讀成「證明兩個模型一樣好」是過度解讀,正確的讀法是 這麼短的樣本本來就看不出中等大小的差別 。
更重要的一條限制 :這次的切法沒辦法重測先前那次的大部分視窗。先前評了 1926 天,這次在同一段年份裡只評到 445 天,其餘的日子都被各段的初始視窗吃掉了。所以本文不能說「先前那個結果重跑不出來」,只能說 在能重測到的那一小塊裡看不到它 。
還有一點要講清楚:這篇不是說先前那份實驗算錯了。它在自己的樣本上算得沒問題,錯的是把那個結論當成比特幣的普遍屬性,搬到別的期間用。
帶走一句話
看到「某某模型比較好或比較差」這種結論,先問它的資料涵蓋哪幾年,再問那幾年裡有沒有哪一段特別長。這篇的三根長條就是答案的形狀:一根很深,兩根幾乎貼著零;而那根很深的,落在原本沒人評過的年份裡。
本文的數字全部來自本站實驗的結果檔(比特幣兌美元日資料,二○一五年一月一日至二○二六年四月十五日,4121 個交易日)。三段各自以滾動視窗做事後評分(視窗 750 天、每 63 天重新估計),評分對象是報酬平方,模型比較採用標準的兩模型誤差比較檢定並做小樣本校正。
懶人包圖組



