← 研究動態
研究2026/10/07 下午04:00

K1746:組合 VaR/ES 由下而上合成或整包估計?聯合分數一致偏向 bottom-up,但 Holm 校正後不顯著,兩者的違反都可被預測

資產配置研究方法風險值多重比較預期損失回測檢定

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

組合的 1% 與 5% 單日風險值(VaR)與預期損失(ES),可以直接對組合報酬估計(top-down),也可以先估各成分的波動,再把各成分同一天的標準化殘差依權重合成(bottom-up)。K1746 在 SPY、TLT、GLD、HYG、QQQ 五檔等權組合上比較這兩個方向,另把「各檔 VaR/ES 依權重直接相加」列為忽略相依的診斷組。

結論分三層。第一,聯合分數 FZ0 在兩個信賴水準都偏向 bottom-up,而且六種設定裡有五種方向一致;但 Holm 校正後兩個差值都不顯著,預先登錄的「方向優越」判準沒有達到。第二,bottom-up 的優勢依賴同日經驗相依:把各檔殘差打散成獨立後,方向翻向 top-down,而且幅度最大。第三,三種方法在動態分位數檢定(DQ)下都被拒絕:違反次數接近名目值,但違反本身仍可被前期資訊預測。

一般讀者版〈一籃子 ETF 明天最多賠多少〉處理的是直接相加過於保守這件事;本篇處理另一個問題:兩個方向之間的差別,在完整的檢定族與多重比較下站不站得住。

設計

  •  資料 :yfinance 調整後收盤(auto_adjust=True),由 K1727 於二〇二六年七月凍結;五檔取共同交易日,不補值,共 4854 個價格列、4853 個報酬列。主設定的樣本外預測日從二〇一〇年四月十五日到二〇二六年七月二十七日(K1746_forecasts.csv.gz),共 4095 天。
  •  濾波 :各成分與組合都用同一套 EWMA 波動濾波,目標日 t 的波動訊號一律以 signal.shift(1) 形成,殘差視窗只到 t-1。
  •  bottom-up :以殘差視窗內的每一個歷史日 s,計算 Σ w_i σ_{i,t} z_{i,s},取經驗 α 分位數為 VaR、分位數以下的平均為 ES。同一天的殘差向量一起使用,所以保留了視窗內觀察到的非線性同步。
  •  top-down :對同一個組合報酬目標、同一個濾波與視窗做 FHS。
  •  naive :各檔 VaR/ES 依權重直接相加,等於假設五檔同一天一起落到最壞的分位數;只當診斷,不進正式比較。
  •  檢定族 :每個方法與信賴水準各做 Kupiec UC、Christoffersen 獨立性(IND)與條件涵蓋(CC)、DQ(四期違反落後加上 VaR 本身),以及 Acerbi–Szekely Z2 的 ES 動差檢定(成對移動區塊 bootstrap)。三個方法 × 兩個 α × 五個檢定共三十格,一起做 Holm。
  •  聯合分數 :FZ0 是 VaR 與 ES 共同可引出的損失函數,越低越好。兩個方向的日損失差用成對移動區塊 bootstrap(區塊長度 10、兩千次、種子 42)檢定,兩個 α 另做一次 Holm;並以同一套 bootstrap 做兩候選的模型信賴集(MCS,信賴水準九成)。
  •  預先登錄的正面判準 :多重比較校正後聯合分數顯著、校準拒絕較少、敏感度方向至少四分之三一致,三者同時成立才算方向優越。

校準:違反次數接近名目值,但違反可以被預測

下表的檢定欄位是 Holm 校正後的 p 值(三十格一個族),*表示在 5% 拒絕。

方法α違反期望違反率UCINDCCDQES Z2
整包直接估(top-down)0.014640.951.12%1.0000.002*0.009*<0.001*1.000
整包直接估(top-down)0.05208204.755.08%1.0000.0760.219<0.001*1.000
逐檔再依同日相依合成(bottom-up)0.015240.951.27%0.7660.0630.063<0.001*0.948
逐檔再依同日相依合成(bottom-up)0.05212204.755.18%1.0000.1100.264<0.001*1.000
逐檔直接相加(naive)0.01840.950.20%<0.001*0.112<0.001*<0.001*0.009*
逐檔直接相加(naive)0.0544204.751.07%<0.001*0.002*<0.001*<0.001*0.009*

三個方法、兩個 α、五種檢定共三十格的 Holm 校正 p 值;顏色越深代表越強的拒絕,DQ 一欄六格全部拒絕

三點觀察:

  •  違反次數本身沒有問題。  top-down 與 bottom-up 在兩個 α 的 UC 都不拒絕;1% 下 bottom-up 違反 52 次、top-down 46 次,名目期望 40.95 次。
  •  DQ 對兩個正式方法都拒絕。  DQ 把違反指標對前四期違反與 VaR 本身迴歸,拒絕代表違反的發生可以用已知資訊預測。換句話說,兩種方法都抓對了「多常越線」,但沒有抓對「什麼時候越線」。
  •  top-down 在 1% 多了獨立性與條件涵蓋的拒絕。  Holm 後的拒絕數是 bottom-up 2 格、top-down 4 格、naive 9 格。這個計數符合預先登錄的「校準拒絕較少」,但它本身不是排序:拒絕數是三十格裡的布林加總,對檢定之間的相關性沒有校正。

naive 的九格拒絕主要來自過度保守:1% 下只違反 8 次,ES Z2 也在兩個 α 拒絕。

聯合分數:方向一致,但校正後不顯著

αbottom-up 平均 FZ0top-down 平均 FZ0差值(bottom-up 減 top-down)雙尾 p單尾 p(bottom-up 較佳)Holm p(兩個 α)
0.01-3.9131-3.8650-0.04820.0960.0570.192
0.05-4.3772-4.3688-0.00840.4530.2440.453

兩個差值都是負號,也就是 bottom-up 的聯合損失較低。1% 的雙尾 p 是 0.096,MCS 以 0.10 的淘汰門檻在主設定(區塊 10、兩千次)下剔除了 top-down,只留下 bottom-up;但兩個 α 一起做 Holm 之後,p 是 0.192,不顯著。把 MCS 的區塊拉長到 20、重抽一千次,1% 的雙尾 p 變成 0.140,兩個方法都留在信賴集內。5% 的差值在任何設定下都不顯著。

所以「MCS 只剩 bottom-up」這個結果,對區塊長度敏感,而且沒有通過預先指定的多重比較;它不能被讀成 bottom-up 勝出。

敏感度:方向穩定,翻轉只發生在拿掉相依的時候

六種設定下 FZ0 平均損失差(bottom-up 減 top-down),負值代表 bottom-up 較佳

設定樣本外天數α=0.01 差值α=0.05 差值方向
主設定(窗 756、同日經驗相依、FHS、每日再平衡)4,095-0.0482-0.0084bottom-up 較佳
窗改 5044,347-0.0544-0.0065bottom-up 較佳
每週重設權重4,095-0.0441-0.0070bottom-up 較佳
常態分配+EWMA 共變異4,095-0.0357-0.0055bottom-up 較佳
只看 2020 年以後1,649-0.1118-0.0393bottom-up 較佳
打散同日相依(各檔獨立重排)4,095+0.3594+0.1237top-down 較佳

六種設定、兩個 α,共十二格,有十格偏向 bottom-up;扣掉主設定本身,五種替代設定的十格裡有八格偏向 bottom-up。預先登錄的方向穩定門檻(四分之三)因此達到。

兩格例外都來自同一個設定:把各檔殘差在視窗內獨立重排,等於讓 bottom-up 只保留各檔的邊際分配、丟掉同一天一起動的資訊。這時方向翻向 top-down,而且差值(1% 為 +0.3594)比任何偏向 bottom-up 的格子都大。這個對照指出 bottom-up 那一點優勢的來源:同日經驗相依。逐檔估波動本身帶不來它。也說明它的反面:如果 bottom-up 的實作沒有保留同日相依,它會比直接對組合估還差。

只看二〇二〇年以後(1649 天),1% 的差值放大到 -0.1118;這段樣本包含二〇二〇年三月與二〇二二年兩段壓力期,與「相依在壓力期改變時,保留同日殘差的方法較能跟上」一致,但這是子樣本描述,沒有另做檢定。

判定

三個預先登錄的條件裡,「校準拒絕較少」與「方向穩定」兩項成立,「多重比較校正後聯合分數顯著」不成立,所以判定是 NULL_NO_MULTIPLICITY_AWARE_DIRECTIONAL_SUPERIORITY:沒有足夠證據說 bottom-up 在這個五檔組合上優於 top-down。反方向同樣不成立,也沒有證據說 top-down 較好。

對實務的含意比較窄:

  • 若要用 bottom-up,必須保留同日的經驗相依;以獨立邊際合成會明顯變差。
  • 兩種方向都需要額外處理違反的叢聚:DQ 拒絕顯示單靠 EWMA 加 FHS,違反的時間點仍可預測。
  • 直接相加不是保守的「安全版」,它在 FZ0 與 ES 檢定上都被懲罰,資本會被系統性高估。

限制

  • ETF 共同樣本受 HYG 上市時間限制,起點是二〇〇七年四月;調整後價格是 yfinance 目前版本的產物,不是交易所逐版本的時點資料。
  • FHS 的尾部支撐受限於滾動視窗;1% 的有效尾部事件不多,ES Z2 與 DQ 的 p 值是有限樣本近似。
  • 同日經驗相依只能重現視窗內看過的共同極端,無法外推沒發生過的尾部相依。
  • 每週重設權重是慣例敏感度,沒有完整的交易成本模型。
  • MCS 只有兩個候選;naive 刻意排除在外。
  • 二〇二〇年以後子樣本與相依機制的連結是事後描述,沒有預先登錄。

資料與程式:experiments/K1746/(K1746.py、K1746_results.json、K1746_forecasts.csv.gz、K1746_inference_cells.json);非作者審查判定 PASS(二〇二六年八月三十日)。主要文獻:Fissler & Ziegel(2016)、Hansen, Lunde & Nason(2011)、Acerbi & Szekely(2014)、Engle & Manganelli(2004)、Wang & Wang(2025)。

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
K1916:檢定日曆效應時,HAC 與日曆平移虛無會給出相反判斷——水星逆行八項預註冊檢定的推論比較
檢定一個日曆效應(假日、議息會議、月相、星象)時,研究者通常把它寫成一個虛擬變數,再用 HAC 標準誤或區塊 bootstrap 做推論。這篇要回答的是:當處置變數是日曆的確定函數時,這兩種常見推論和「把日曆整段平移」的隨機化虛無,會不會給出不同的答案? 答案會影響你該相信哪一個 p 值,以及預註冊時要把哪一個定為主推論。 我們用的例子是水星逆行。它的好處是處置日曆完全由天體運動決定、與市況無關,…
→
📄
預估最壞一天的虧損:常態假設在四格測試都被抓到低估,厚尾模型的名次隨標的而變、差距多半看不出來
同一套波動率模型、四種「極端下跌長什麼樣」的假設,在美股大盤 ETF(SPY)和高收益債 ETF(HYG)上各測 5% 與 1% 兩個風險水準,共四個測試格。日報酬從 2007-04-12 到 2026-07-02(4,837 天),樣本外從 2015-01-01 起算,每格 2,891 個交易日。 結果可以分成兩層,穩的在前面: 常態假設不夠,這一層最穩。 用「預期損失」(ES,跌破 VaR 時…
→
📄
K1925:同一對低波動與高貝塔 ETF,原始相關有強烈斷點,扣掉大盤後就沒有——相關的定義決定 regime 結論
判斷兩檔因子 ETF 的關係「是否進入新階段」時,第一個要選的是相關怎麼定義,檢定方法反而在其次。這篇用低波動(SPLV)與高貝塔(SPHB)回答一個方法問題:同一對 ETF、同一段期間、同一組斷點檢定,換一個相關定義,結論會不會翻過來? 會。原始報酬相關有樣本內最強的斷點,近期降到樣本內最低;扣掉大盤之後的偏相關,兩項預註冊檢定都沒有證據。兩個答案回答的是不同的問題,用錯一個就會下錯判斷。 設計…
→