← 研究動態
一般讀者2026/07/22 上午08:07

換一個樣本期,一半的策略當場死掉:我們公開自己 68 個實驗的成績單

回測研究方法樣本外驗證過度配適自我揭露

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

換一個樣本期,一半的策略當場死掉:我們公開自己 68 個實驗的成績單

網路上流傳的策略回測圖,幾乎沒有一張是難看的。

原因很簡單。難看的那些,作者自己就先刪掉了。

我們做的是波動率預測研究,測試了幾百個想法。這篇文章要做的事情不太尋常:把我們自己的失敗率完整攤開來,包括那些跑完只能寫下「沒用」兩個字的實驗。

68 次嘗試,15 次真的有效

2026 年 3 月,我們把連續編號的 68 個實驗全部重新分類統計。這 68 個實驗每一個都是認真的嘗試:某個指標能不能預測波動、某個模型改良有沒有用、某個訊號能不能拿來下單。

分類完的成績單長這樣。

結果類型白話說明實驗數
null完全沒效果24
informative沒賺到錢,但學到市場的某個性質21
positive明確有效15
partial部分條件下有效6
meta回顧整理1
correction更正先前的錯誤1

明確有效的比例是 22.1%。完全沒效果的比例是 35.3%。

68 個實驗的結果分佈,沒效果佔 35.3%、明確有效佔 22.1%

換算成一個更直接的數字:平均每 8.5 個實驗,才換得到一個站得住腳的發現。

這個比例對做研究的人來說不算意外。對只看過網路貼文的投資人來說,落差可能很大。你在社群上看到的成功案例,背後大概也有這樣一堆屍體,只是沒人貼出來。

真正殘忍的那一關

上面的失敗率還算溫和的。真正砍人的關卡在後面。

我們的流程裡有一道「跨樣本期驗證」:一個想法在某段歷史資料上表現不錯之後,換一段完全不同的期間,用同樣的參數再測一次。參數不准調,模型不准改,就是換資料重跑。

68 個實驗裡有 18 個走到了這一關,其中 17 個有明確的存活或陣亡判定。

結果是 8 個存活,9 個陣亡。陣亡率 52.9%。

單期看起來有效的 17 個候選,換一個樣本期重測後只有 8 個存活

階段通過數對照
單一樣本期看起來有效17100%
換一個樣本期後仍有效847.1%
換樣本期後失效952.9%

陣亡的那九個、存活的那八個,編號逐一列在原始結果檔裡,任何人都可以自己去對。

每一個陣亡的實驗,在第一段樣本期都拿出過看起來漂亮的成績。如果我們當時停手發文,會有九篇讀起來很有說服力、但其實禁不起換期考驗的文章。

擲硬幣的存活率是 50%。我們這 17 個候選的存活率是 47.1%。

學界早就算過這筆帳

這個現象在學術界有名字,也有人算過代價。

嚴格統計、Liu 與 Zhu 在 2016 年發表於 Review of Financial Studies 的研究中,檢視了財務學文獻累積提出的數百個「能預測報酬的因子」。他們的論點是:當一整個領域在同一批歷史資料上反覆測試上百個想法,光靠傳統的顯著性門檻篩選,必然會放進大量純屬運氣的發現。

他們建議把門檻大幅拉高。我們自己的 52.9% 陣亡率,可以當成這個論點的一份小型佐證。

差別在於,他們檢視的是整個學界的公開發表結果,而發表本身就有篩選偏誤,失敗的研究通常不會出現在期刊上。我們手上這 68 筆是完整紀錄,跑完就記,沒有中途丟棄。

我們把流程改成什麼樣

發現這件事之後,我們改了三個地方。

第一,跨樣本期驗證從最後一關往前挪。過去是先把一個方向的各種變體都試過,最後才驗一次;現在核心想法一有初步結果就先換期重測。省下來的算力可觀,更重要的是省下對假發現的感情投入。

第二,同一個方向連續兩次沒效果就停手,不再繼續往下挖。

第三,每累積約 20 個實驗就做一次整體回顧。這篇文章的來源就是這種回顧,它改變研究方向的效率比再多跑十個實驗高。

順帶一提,前一次同類型回顧涵蓋 35 個實驗,當時的無效率是 48.6%;這次涵蓋 68 個,降到 35.3%。流程調整有反映在數字上。

至於通過所有關卡的東西長什麼樣:我們目前最穩的一個發現,是把恐慌指數 VIX 加進波動率模型。它在五段互相獨立的樣本期裡全部勝出,平均把預測誤差壓低 17.4%。五段全過,才叫可以拿來用。

陣亡名單裡還藏著另一個教訓。其中有三個實驗,測的都是同一件事:把一個預測得還不錯的模型,接上實際的下單規則。

三個全部失敗。模型把明天的波動猜得比對照組準,換算成部位調整、扣掉交易成本之後,績效優勢就消失了。

猜得準跟賺得到,中間隔著一道我們原本低估的距離。看到一張漂亮的預測準確度圖表時,這道距離通常沒有被畫出來。

你可以怎麼用這件事

看到別人貼回測績效時,有幾個問題值得先問出口。

這條策略在哪一段期間測的?換另外一段還成立嗎?參數是怎麼定下來的,有沒有在同一批資料上反覆調整過?測試過程中,總共試了多少個沒被貼出來的版本?

最後一個問題最關鍵,也最難得到答案。試了 100 個想法挑出最好的那個拿來炫耀,跟只試了一個就成功,看起來完全一樣,實質差很遠。

我們自己的紀錄是:試了 68 個,其中 15 個明確有效;再拿去換期重測的 17 個候選裡,活下來 8 個。

這個成績不好看。但沒有一張隱藏的成績單,是比它更好看的。


資料來源:experiments/k492/k492_research_efficiency_results.json(研究效率回顧,統計時間 2026-03-26,涵蓋連續編號的 68 筆結果檔,實驗編號逐筆列在該檔內)。文中結果分佈、無效率 35.3%、有效率 22.1%、跨樣本期存活 8 與陣亡 9、陣亡率 52.9%、平均 8.5 個實驗換一個驗證發現,均直接取自該檔。

外部參照:嚴格統計, C. R., Liu, Y., & Zhu, H. (2016). "…and the Cross-Section of Expected Returns." Review of Financial Studies, 29(1), 5–68.

免責聲明:本文為研究方法與教育用途,呈現的是我們內部研究流程的歷史統計,不構成任何投資建議。投資請自行判斷並承擔風險。

懶人包圖組

概念說明:單期回測有效與跨樣本期仍有效是兩件事

實驗結果分佈:完全沒效果、明確有效的比例,以及平均幾個實驗換一個驗證發現

走到跨樣本期驗證的實驗中,超過一半在換樣本期後失效

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
低波動 ETF 和高貝塔 ETF 最近變得同進同退了嗎?預先註冊的檢定沒有找到證據
市場上有一種說法:防守型的低波動股票和進攻型的高貝塔股票,原本一個漲、一個跌,最近卻開始「同步走強」,兩者的關係進入了新階段。 我們把這個說法做成事先註冊的檢定,用 SPLV(低波動 ETF)和 SPHB(高貝塔 ETF)的日報酬,看扣掉大盤之後,兩者的相關有沒有出現結構性的移動。兩項檢定都沒有找到證據。 先講結論 沒有找到證據顯示相關出現新階段。 主配對 185 個月(2011 年 5 月至 2…
→
📄
今晚八點半非農公布:台指期夜盤公布後那三十分鐘,過去九年多比平常的晚上動得兇多少?
今晚台灣時間八點半(美東早上八點半,夏令時間),美國公布非農就業數據。台指期的夜盤在這一刻前後,波動會比平常大多少、又能撐多久? 我們把過去的非農夜一個一個翻出來,量了公布後三個三十分鐘的窗。先講清楚:這是回看過去的描述,不是預測今晚的方向或大小,今晚這一次也沒有放進任何數字。 先講結論 公布後的第一個三十分鐘,台指期夜盤的波動明顯放大。 把公布前三十分鐘當分母,事件夜公布後的升幅,是對照夜同一時…
→
📄
銀行收緊放款時,債券 ETF 劇烈震盪會讓隔天股市更不安嗎?十九年資料:不必另設一道警報
美國聯準會每一季會問各大銀行:最近對企業放款,標準是放寬還是收緊?當回答「收緊」的銀行明顯多過「放寬」,市場常把它當成信用變緊的訊號。一個常見的延伸想法是:在這種時期,高收益債或貸款類 ETF 一旦出現劇烈震盪,隔天的股市就更容易跟著不安,所以要對債券 ETF 的動靜特別敏感,甚至提早減碼股票。 這篇回答的就是這個決策:銀行收緊放款的期間,要不要把債券 ETF 的單日劇烈波動,當成比平常更強的股市…
→