四個市場全都變好了,卻只有一個站得住——「有改善」和「證明有改善」差在哪
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
有一件事在美股大盤上已經測過很多次:預測明天的波動時,除了看這支標的自己過去怎麼跳,再多看一眼市場整體的恐慌指數,預測會變準。
聽起來很合理。恐慌指數本來就是全市場情緒的匯集點,它先動,個別標的後動。
合理的下一個問題是:那換到別的市場呢?新興市場、黃金、台股大盤,同一招搬過去還有用嗎?
有人把這個問題老實測了一遍。同一套模型、同一段期間、同一種評分方式,四個標的各跑一次。
這場測試怎麼跑
資料從 2005 年初抓到 2026 年 4 月 8 日。模型每次只用當下之前的兩千個交易日估參數,每隔一段時間重估一次,然後往前預測明天的波動。
真正用來評分的是 2019 年之後的那段,模型在估參數的時候完全沒看過。
每個標的都跑兩個版本:一個只看自己的歷史,另一個多接一條恐慌指數的線。兩邊的預測拿去跟事後真實發生的波動比對,算出一個誤差分數,分數越低越好。
先看四根柱子

| 標的 | 只看自己 | 多接一條線 | 誤差下降 |
|---|---|---|---|
| 美股科技股 | 1.481572 | 1.417530 | 4.32% |
| 新興市場 | 1.338249 | 1.304968 | 2.49% |
| 台股大盤 | 1.454281 | 1.430473 | 1.64% |
| 黃金 | 1.533768 | 1.514613 | 1.25% |
四根柱子全部朝同一個方向。沒有一個標的因為多接那條線而變差。
如果一份報告在這裡就收尾,結論會寫成:這招在四個市場全部有效,改善幅度介於一點多到四個百分點之間。
那份報告會是錯的。
再看門檻
問題在於「誤差下降 1.25%」這句話沒有講完。它沒有講的是:這個下降幅度,會不會只是運氣。
同一段期間換成另外一千八百天,這個差距還在不在?這才是要問的。判斷方法是把每一天的誤差差額攤開來看,算出這個平均差距相對於它自己的起伏有多穩。差距穩定地存在,證據就強;差距忽大忽小、只靠幾個特別的日子撐著,證據就弱。
這一行有一條公認偏嚴的線。要跨過它,差距必須穩到某個程度才算數,這條線刻意訂得比一般的顯著性標準嚴,理由是同一批資料被反覆試過太多種模型,寬鬆的標準會放進太多假發現。

| 標的 | 證據強度 | 過線了嗎 |
|---|---|---|
| 美股科技股 | -3.77 | 是 |
| 新興市場 | -2.79 | 否 |
| 台股大盤 | -1.45 | 否 |
| 黃金 | -1.32 | 否 |
四個裡面只有一個過線。
差一點的那個最值得看
新興市場那一格是 -2.79。門檻是 -3.0。
它的誤差確實下降了 2.49%,是四個裡的第二名,而且如果換一條比較寬鬆的線,它會被算成通過。
它沒過,不是因為改善幅度小,是因為那個改善不夠穩定。同樣的兩年半,好的時候特別好、平的時候完全沒差,攤開來看就撐不住。
這一格在報告上最後被寫成「沒有通過」,跟黃金那一格擺在一起。但這兩格的意思其實不一樣:一個是差臨門一腳,另一個是本來就看不出東西。只寫「未通過」會把這個差別抹掉。
同步程度不能拿來當預測
還有一件事更違反直覺。
測試裡有一個順帶量到的數字:每個標的的實際波動,跟那條恐慌指數線的同步程度。直覺上會猜,越同步的市場,接上這條線的效果應該越好。
實際數字是這樣:新興市場的同步程度 0.4989,是四個裡最高的,甚至比通過的美股科技股(0.4936)還高一點點。可是它沒過。台股大盤是 0.2751、黃金是 0.1263,兩個都沒過。
所以同步程度高不保證有用。這條線跟你的標的走得像,跟它能不能替你多預測出一點東西,是兩件事,走得像可能只是兩邊都在反應同一場風暴,事後看起來同步,事前並不多提供資訊。
幾個要說清楚的限制
樣本上,黃金與新興市場各有一千八百多天的評分期,台股大盤是一千六百多天,比其他三個短一些。四個標的都只跑了一種模型設定,換一種設定結果可能不同。
評分只用了一種誤差算法。這一行有好幾種算法,換一把尺有時候名次會變,這一點在別的測試裡已經看過不只一次。
最後,這裡驗的是「多接這條線有沒有幫助」,不是「這是不是預測波動最好的做法」。四個標的的基準都是同一種只看自己的模型,沒有跟其他主流做法比過。
可以帶走的兩件事
第一件,一整排都朝同一個方向的柱狀圖,不等於一整排都成立。四個標的的分數全部改善,可是三個的改善禁不起追問。方向一致很容易發生,尤其是在多加一個變數之後,多一個變數本來就傾向讓誤差變小。
第二件,看到跨市場的推廣宣稱,先問它在幾個市場上真的過關。這份測試的正式結論寫得很克制:在四個標的裡只有一個顯示出站得住的改善。這份測試本身沒有推翻美股大盤上的原發現,被推翻的是「它可以照搬到別的市場」這個順理成章的延伸;至於過線這件事本身,後來也發現依賴測試設定(見〈後續補查〉)。
後續補查:換個設定,結論還站得住嗎
這份測試的設定,後來被拆開檢查過兩次。
第一項是訓練視窗的長度。同一個檢驗把視窗從兩千個交易日改成五百、一千與一千五百天,美股科技股的證據強度(一樣取絕對值看)是 1.74、2.46 與 3.31,門檻是 3.0。五百天與一千天沒過線,一千五百天剛過線,高出門檻的幅度比這套程式自己量到的數值雜訊(約 0.63)還小。兩千天(原值)是 3.77,三千天是 4.42。也就是說,這一格過線,靠的是訓練視窗取得夠長。
第二項是「只看自己」那個對照組的估計方式。另一項檢查把美股大盤那一格的對照組改用標準的多起點估計法,其餘完全不動,證據強度由 4.49 降到 2.56,不再過線;多接那條線的誤差仍然比較低,但穩不穩,沒有結論。美股科技股沒有用同樣方式重算,所以它的證據強度在標準對照組下是否維持,這篇文章答不出來。
這兩項檢查本身也有限制:視窗檢查是事先登錄但非盲的,判定只在事先寫定的規則與雜訊範圍下成立,八個設定裡任何一個越界就算翻盤,帶有多重尋找的成分。它們不表示多接恐慌指數沒有用,也不表示哪個視窗最好;它們表示,這裡的「過線」依賴測試時選的設定。
懶人包圖組




相關文章
先讀正式關聯,若無則使用標籤與主題相似度補齊