← 研究動態
研究2026/08/11 下午02:00

USMV 的低波動優勢,為什麼在最大回撤上幾乎不見了

風險管理低波動尾端風險因子投資美股 ETF檢定設計

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

K1446 對 USMV 和四檔對手做了八個配對檢定,八個全部通過 Bonferroni 校正,最大的那個 p 值比校正後的門檻還低十六個數量級,bootstrap 抽 5,000 次沒有一次翻盤。

檢定結果這麼一面倒,第一件該做的事是檢查檢定設計,而不是直接把它當結論用。這篇文章先拆設計,再說明為什麼「顯著」在這裡的資訊量比想像中小,最後指出資料裡真正值得注意的那個落差:同一組 ETF,年化波動從 SPY 的 17.05% 降到 USMV 的 13.84%,最大回撤卻只從 -33.72% 變成 -33.10%。前者少了三個百分點以上,後者不到一個百分點。

檢定怎麼設計的

樣本是 MTUM、QUAL、USMV、VLUE、SPY 五檔的日報酬,資料來自 yfinance。五檔各自的上市時間不同,USMV 從 2011-10-21 就有資料,QUAL 要到 2013-07-19,所以共同樣本從 2013-07-19 起算,到 2026-06-09 為止,3,242 個交易日。隨機種子固定為 42。

配對檢定用的是 非重疊的 21 個交易日區塊 ,共 154 塊。這個選擇是設計裡最關鍵的一環。滾動視窗會讓相鄰觀測共用大部分資料,波動率本身又有很強的持續性,兩者疊在一起會讓有效樣本數遠小於名目樣本數,p 值因此被系統性壓低。改用不重疊的切法,154 塊之間的相依程度大幅下降,代價是樣本數從三千多降到一百五十幾。

每一塊裡計算兩個指標:已實現波動(rv)與下行離差(downside_dev)。四檔對手各兩個指標,共八個檢定。檢定用 Wilcoxon 符號秩檢定,單尾,對立假設是「對手的風險高於 USMV」。八個檢定做多重比較校正,Bonferroni 後的門檻是 α = 0.00625。另外對每個配對差額做 5,000 次 bootstrap,取 95% 信賴區間。

八格檢定結果

對手指標USMV 區塊均值對手區塊均值差額bootstrap 信賴區間單尾 p 值
MTUMrv0.11280.17090.0581[0.0505, 0.0663]2.36e-26
MTUMdownside_dev0.07630.11620.0399[0.0336, 0.0466]4.06e-25
QUALrv0.11280.14480.0320[0.0280, 0.0363]1.07e-24
QUALdownside_dev0.07630.09720.0209[0.0174, 0.0244]6.22e-20
VLUErv0.11280.15870.0459[0.0407, 0.0515]1.70e-26
VLUEdownside_dev0.07630.10690.0306[0.0261, 0.0353]2.81e-23
SPYrv0.11280.14300.0301[0.0262, 0.0346]1.36e-24
SPYdownside_dev0.07630.09640.0202[0.0166, 0.0238]2.59e-19

八個 CI 都不含 0,八個 bootstrap 的「對手風險大於 USMV」機率都是 1.000。

這裡要對 p 值的量級講清楚一件事。1e-26 這種數字不代表效果強到不可思議,它反映的是排序的 一致性 :154 塊裡 USMV 幾乎每一塊都排在對手下面。Wilcoxon 檢定的是符號的一致程度,不是幅度。真正該讀的幅度資訊在 CI 那一欄,例如對 SPY 的區塊波動差額是 0.0301,相對 SPY 自己的 0.1430 約低 21%。這個幅度可觀,但和「1e-24」給人的印象是兩件事。

換個角度說,多重檢定校正在這份資料上根本沒有起到篩選作用。門檻是 0.00625,而八個檢定裡最大的那個 p 值比它還低十六個數量級。校正該做還是要做,但它在這裡沒有排除任何東西,不能拿來當作「結論通過了嚴格審查」的證據。

尾部指標壓的是幅度,頻率沒有動

全樣本的尾部統計提供了區塊檢定看不到的資訊:

ETF年化波動VaR 5%ES 5%負報酬日占比最差單日最大回撤
MTUM19.90%-1.93%-3.08%44.05%-13.20%-34.08%
QUAL17.17%-1.61%-2.61%45.10%-10.74%-34.06%
USMV13.84%-1.19%-2.05%44.20%-10.63%-33.10%
VLUE18.75%-1.76%-2.81%45.62%-13.57%-39.47%
SPY17.05%-1.62%-2.62%44.66%-11.59%-33.72%

左尾的幅度確實被壓下來了。USMV 的 VaR 5% 是 -1.19%,SPY 是 -1.62%,MTUM 是 -1.93%;ES 5% 分別是 -2.05%、-2.62%、-3.08%。以絕對值看,USMV 的單日左尾比 SPY 少約四分之一,比 MTUM 少約三分之一。

負報酬日占比則完全沒有排序。USMV 是 44.20%,MTUM 反而更低,44.05%。五檔全部落在 44% 到 46% 之間,區間寬度 1.6 個百分點。低波動的定位在下跌 頻率 上沒有留下任何痕跡,它作用在下跌那天的 幅度 上。這對用「勝率」或「上漲天數」評估低波動產品的做法是個直接的反例。

落差出現在時間尺度上

把日頻指標和最大回撤放在一起比,會看到一個不連續:

對手年化波動 USMV 低了最大回撤 USMV 小了
MTUM30.5%2.9%
QUAL19.4%2.8%
SPY18.8%1.8%
VLUE26.2%16.1%

USMV 相對四檔對手的年化波動降幅與最大回撤降幅

對 MTUM、QUAL、SPY 三檔,年化波動的優勢有近兩成到三成,到了最大回撤只剩不到一個百分點多一點。VLUE 是例外,它的 -39.47% 是五檔裡最深的一筆,USMV 對它保有 16.1% 的優勢。

單日波動和最大回撤衡量的是不同東西。前者是報酬分布的離散程度,後者是路徑上高點到低點的累積,取決於連續下跌能延續多久、期間的日報酬是不是同號。一個組合可以每天晃得比較小,卻在系統性壓力期跟著所有人一起往下走同樣久。USMV、SPY、QUAL、MTUM 四檔的最大回撤分別是 -33.10%、-33.72%、-34.06%、-34.08%,擠在一個不到一個百分點寬的帶子裡,指向共同的系統性壓力期。這份結果檔只記錄回撤的數值,沒有記錄它發生的時點,所以是哪一段壓力期造成的,這裡不做推測。

需要說清楚的是,K1446 沒有檢定這件事。實驗做的是全樣本統計加上區塊配對檢定,最大回撤只是描述性的單一數字,一個樣本一個觀測值,沒有分布、沒有信賴區間、沒有檢定。上面那個落差是資料裡看得到的模式,不是被證實的結論。要把它變成結論,至少要做壓力期分段的相關性估計,或是用 block bootstrap 重抽路徑去取得回撤的抽樣分布。這是 K1446 留下的可執行後續,不是它已經回答的問題。

USMV 與四檔對手的 63 日滾動波動

這份設計沒有回答什麼

 ETF 層級,不是因子層級。  五檔標的都是實際交易的 ETF,含管理費、編製規則、再平衡時點與追蹤誤差。USMV 的風險輪廓低於 SPY,這是 iShares 這檔產品的性質,不能直接讀成低波動因子存在溢酬。要談因子本身,得回到成分股與因子組合層級。

 單一樣本期,沒有跨期驗證。  2013-07-19 到 2026-06-09 是一段以多頭為主、中間夾一次快速崩跌與一次升息循環的期間。154 個區塊在統計上足夠,在體制涵蓋上不足。USMV 在利率快速上行期的表現是不是同樣安靜,這份資料切不出來。

 報酬面沒有納入檢定。  USMV 的年化報酬 9.95%,是五檔裡最低的,低於 SPY 的 13.15%。這個差距沒有被做任何風險調整後的顯著性檢定,八個檢定全部只針對風險指標。任何形式的「用一點報酬換穩定,划不划算」的判斷,K1446 沒有提供依據。

結論

USMV 在日頻風險指標上的優勢是穩固的,八個配對檢定在保守設計下全數通過,效果量約在兩成到四成之間,取決於對手與指標。同一份資料同時顯示,這個優勢在下跌頻率上不存在,在最大回撤上對三檔對手縮到一個百分點上下。

對研究設計的意涵:用日頻波動衡量的風險降幅,不能外推到多日累積的路徑風險。兩者在這份樣本裡的差距大到一個數量級,把前者當成後者的代理變數會系統性高估防禦效果。

資料來源:VolPred 實驗 K1446,腳本 experiments/K1446/k1446.py,結果 experiments/K1446/k1446_results.json。資料源 yfinance,標的 MTUM、QUAL、USMV、VLUE、SPY,共同樣本 2013-07-19 至 2026-06-09,3,242 個日報酬觀測值,隨機種子 42。檢定設計為非重疊 21 日區塊(154 塊)、Wilcoxon 單尾符號秩檢定、Bonferroni 校正 α = 0.00625、bootstrap 5,000 次。

相關文獻:Blitz & van Vliet (2007) The Volatility Effect;Frazzini & Pedersen (2014) Betting Against Beta;Baker, Bradley & Wurgler (2011) Benchmarks as Limits to Arbitrage。

相關實驗:K89(因子傾斜與波動目標的 null result)、K566(因子輪動 null result)、K876(MTUM 崩跌風險與 VIX)。

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
K1884:拿 VIX1D 對照 SPY 同一天的已實現變異,年化分母、報價時點與盤中窗口各自能把答案改掉多少
一般讀者版〈一日恐慌指數開盤報的當日變異,平均是 SPY 盤中實際的 1.56 倍:這個數字該怎麼讀〉給的是水準與讀法。這篇處理做這個比較時要先決定的三件事:VIX1D 要除以哪一個年化分母、要拿哪一個時點的報價、已實現變異要涵蓋盤中哪一段。 K1884 的結果顯示,這三個選擇造成的偏移,與要量的效果同一個量級;選錯任何一個,程式不會報錯,只會回答另一個問題。 先釐清估計量。K1884 量的是同一…
→
📄
K1378:VIX 長期成分讓 SPY 波動預測勝過 GJR-GARCH,這個優勢在疫情窗外更穩定
做風險控管或選擇權定價的人,常要在兩種日頻波動模型之間取捨:只用報酬本身的 GJR-GARCH,或在 GARCH 之外加一個由 VIX 驅動的長期成分。後者多了一個外部變數要維護,值不值得,要看它的預測優勢從哪裡來。如果優勢只來自 2020 年那種市場崩跌的少數日子,平常用它就只是多背一個依賴;如果優勢出現在一般日子,它才是日常可用的改進。 K1378 用 SPY 的樣本外一步預測回答這個問題:A…
→
📄
K1862:HAR-RV 一個月波動預測的誤差,平均偏誤不隨波動水位變號,隨水位變寬的是誤差分布
用 HAR-RV 預測未來一個月波動的人,常會想加一層修正:波動很高時把預測往下調,波動很低時往上調,理由是 HAR 的均值回歸可能修正過頭。這層修正值不值得加,取決於 HAR 的誤差是否真的隨預測當下的波動水位系統性變號。 一般讀者版〈HAR 波動預測的誤差往哪邊偏:六成交易日高估,平均誤差卻幾乎是零〉處理的是整體偏誤。這篇處理條件結構:依預測當下的波動水位把樣本外日子分成五組,誤差的平均、中位…
→