← 研究動態
一般讀者2026/08/09 下午12:00

116 萬筆選擇權交易只是一張地圖,不是那段市場

選擇權資料品質競價機制市場壓力

讀者互動

登入會員可按讚與收藏。

分享到:LINEFacebookX / Twitter

持續追蹤這項研究

收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。

研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。

訂閱研究摘要

研究摘要與新文章,不轉售、不寄廣告,隨時可退訂。

一份資料有  1,161,488 筆交易 ,第一眼很難把它和「資料不夠」放在一起。

這次偏偏就是這種情況。

我們想問的是:散戶選擇權訂單進入短暫競價後,平常看得到的成交改善,到了市場高度緊張的日子還剩多少?公開檔裡確實有超過百萬筆紀錄,其中 384,580 筆屬於競價成交。可是,把交易筆數收回日曆上,只剩 16 個作者改造過的日期;拿前一個收盤日已知的市場恐慌指數去配,達到事前壓力門檻的日期是  0 個 。

百萬筆資料可以把某一天算得很細,卻不能憑空生出一個從未出現的市場狀態。

選擇權競價在做什麼

投資人送出一張選擇權訂單後,券商有時會讓它進入一個很短的電子競價。多家造市商可以在這段時間出價,投資人有機會拿到比原先報價更好的成交價格。

原始研究關心這套機制平均能不能改善成交。我們追問另一層:市場已經很緊張時,造市商可能縮手、報價可能變寬,平常的好處會不會縮小。

這兩個問題需要的資料不同。平均效果可以靠大量交易筆數估;壓力期是否改變效果,還得有足夠多個日期、足夠多個壓力日,以及足夠多個標的。這份公開檔只滿足了第一項。

116 萬筆,攤回日曆只剩 16 天

資料來自 Harvard Dataverse,授權為 CC0 1.0。作者已明確註記:這是為了公開程式流程而製作的縮小版資料,數值經過獨立擾動,標的匿名化,時間戳也和原始美國選擇權逐筆成交資料不同。它不能拿來重現論文中的市場結果。

公開檔的輪廓如下:

檢查項目公開檔實際內容
全部交易列數1,161,488
競價成交列數384,580
競價成交占比33.11%
一般連續成交列數776,908
不同日期16
匿名標的3
日期範圍2020-09-18 至 2020-12-14
落在週末的日期6(占 37.5%)

最值得停下來看的,是最後四列。1,161,488 筆交易集中在 16 個日期,平均每個日期有很多筆,但能用來比較市場狀態的日子仍然只有 16 個。三個匿名標的也無法告訴我們,結果能否跨到更多股票。

六個日期落在週末,進一步提醒我們:這些日期是作者改造後的標記,不能當成真實交易日曆。它們適合檢查程式能否讀檔、分組與加總,不適合貼回歷史市場敘事。

四道資料門,一道都沒開

分析開跑前先寫好四個最低條件。任何一項未過,就停止正式比較,不把描述數字包裝成壓力期證據。

事前條件最低要求實際值結果
不同日期至少 80 個16 個未過
高壓力日期至少 30 個0 個未過
不同標的至少 10 個3 個未過
週末日期必須為 0 個6 個未過

左圖把每個改造日期配上前一個收盤日已知的市場恐慌指數,全部落在固定門檻 30 以下;右圖顯示不同日期、高壓力日期、不同標的與無週末日期四道資料門全部未通過

市場狀態的配對也刻意避開偷看。每個日期只使用前一個收盤日已知的恐慌指數;當天收盤後才知道的數值沒有進入訊號。這 16 個日期對到的數值介於  22.52 到 26.46 ,中位數  25.00 。固定壓力線是  30.00 ,所以高壓力日期仍是 0 個。

時間順序處理正確,只能排除「拿未來資訊解釋過去」這個錯誤。它補不了樣本裡缺少壓力日的事實。

那三根紫色柱子能告訴我們什麼

公開檔仍然可以做描述性加總。把全部改造後的交易合在一起,競價成交相對一般成交的平均差異如下:

公開檔中的描述值競價成交相對差異
價格改善增加4.9088 美分
有效價差降低5.2418 美分
成交品質比率降低0.3957
競價中出現多位出價者的比率5.0705%

三個紫色長條分別顯示改造後公開檔的價格改善增加 4.909 美分、有效價差降低 5.242 美分,以及成交品質比率降低 0.396;圖表只做描述,不代表真實市場壓力期的效果

這些值採全部可用交易列合併計算,各日期沒有先調成相同權重。更重要的是,數值來自經過擾動的公開檔。它們能檢查加總流程與圖表是否一致,不能充當真實市場的報酬或成交品質估計。

正式的壓力期比較完全沒有執行,因此也沒有可報告的統計強度或勝負判定。表格裡的正數看起來像競價較好,讀者仍不能把它延伸成「高度緊張時也有效」。樣本裡根本沒有高度緊張的日期可比。

這次可以下的結論很窄

這份公開檔不足以回答「競價好處在市場壓力下會維持還是縮小」。四道事前資料門全部未過,分析依規則停在正式比較之前。

因此,以下兩句都沒有證據支持:

  1. 市場緊張時,競價好處依然存在。
  2. 市場緊張時,競價好處會消失。

目前能確認的只有資料邊界。公開檔很大,但日期、壓力狀態、標的廣度與交易日曆都不符合這個問題的最低需求。

為什麼「幾筆資料」常會騙人

一百萬筆看起來比一百筆可靠,前提是研究問題也活在「每一筆交易」這個層級。若問題改成「不同市場狀態之間有沒有差」,真正有用的單位會變成日期或事件。

想像你拿到一座球場同一天的十萬張座位照片。你可以很精確地數出那天有多少空位,卻無法靠這十萬張照片比較晴天與雨天的進場率。要做後一題,需要更多天氣不同的比賽日。

這份選擇權資料面對的是同一個限制。交易列數回答「這些改造日期裡有多少筆」,壓力期問題需要「有多少個彼此不同、而且真的跨過壓力線的日期」。兩個分母差了好幾層。

什麼條件下可以重開

重開不需要改研究問題,也不該降低門檻。需要的是一份保留真實交易日與標的身分、可合法使用的選擇權樣本,並同時滿足:

  • 至少 80 個不同交易日;
  • 至少 30 個前一日恐慌指數達 30 或以上的壓力日;
  • 至少 10 個不同標的;
  • 沒有週末偽日期。

屆時仍沿用前一個收盤日的恐慌指數,避免使用當天尚未知道的資訊。四道門全開之後,才估計競價和市場壓力一起出現時,成交改善到底改變多少。

在那之前,最誠實的答案就是「資料尚未涵蓋這個問題」。

下次看到一份號稱有幾百萬列的大資料,先別只問列數。再問四件事:跨了幾個日期、包含幾種關鍵狀態、涵蓋幾個標的、時間戳能不能當真。這四個答案,往往比檔案大小更接近研究品質。


 資料來源 :Khan、Hendershott 與 Riordan,〈Option Auctions〉,Review of Financial Studies 39(3), 783–834;Harvard Dataverse 公開資料,DOI 10.7910/DVN/LMB13N,CC0 1.0。市場壓力序列取自 Federal Reserve Bank of St. Louis FRED VIXCLS,凍結檔涵蓋 2020-08-01 至 2020-12-31;本文只把前一個收盤日已知的數值配到作者改造後的 2020-09-18 至 2020-12-14 日期標籤。所有數字逐項讀自經審查的結果檔;結果檔為保持逐位元重現,刻意不寫執行當下時間。

懶人包圖組

公開改造資料的交易列數、競價列數、不同日期與匿名標的數對照

固定壓力門檻、高壓力日期數、恐慌指數最高值與週末日期占比

改造後公開檔的價格改善、有效價差、成交品質比率與多位出價者比率

相關文章

先讀正式關聯,若無則使用標籤與主題相似度補齊

📄
低波動 ETF 和高貝塔 ETF 最近變得同進同退了嗎?預先註冊的檢定沒有找到證據
市場上有一種說法:防守型的低波動股票和進攻型的高貝塔股票,原本一個漲、一個跌,最近卻開始「同步走強」,兩者的關係進入了新階段。 我們把這個說法做成事先註冊的檢定,用 SPLV(低波動 ETF)和 SPHB(高貝塔 ETF)的日報酬,看扣掉大盤之後,兩者的相關有沒有出現結構性的移動。兩項檢定都沒有找到證據。 先講結論 沒有找到證據顯示相關出現新階段。 主配對 185 個月(2011 年 5 月至 2…
→
📄
今晚八點半非農公布:台指期夜盤公布後那三十分鐘,過去九年多比平常的晚上動得兇多少?
今晚台灣時間八點半(美東早上八點半,夏令時間),美國公布非農就業數據。台指期的夜盤在這一刻前後,波動會比平常大多少、又能撐多久? 我們把過去的非農夜一個一個翻出來,量了公布後三個三十分鐘的窗。先講清楚:這是回看過去的描述,不是預測今晚的方向或大小,今晚這一次也沒有放進任何數字。 先講結論 公布後的第一個三十分鐘,台指期夜盤的波動明顯放大。 把公布前三十分鐘當分母,事件夜公布後的升幅,是對照夜同一時…
→
📄
銀行收緊放款時,債券 ETF 劇烈震盪會讓隔天股市更不安嗎?十九年資料:不必另設一道警報
美國聯準會每一季會問各大銀行:最近對企業放款,標準是放寬還是收緊?當回答「收緊」的銀行明顯多過「放寬」,市場常把它當成信用變緊的訊號。一個常見的延伸想法是:在這種時期,高收益債或貸款類 ETF 一旦出現劇烈震盪,隔天的股市就更容易跟著不安,所以要對債券 ETF 的動靜特別敏感,甚至提早減碼股票。 這篇回答的就是這個決策:銀行收緊放款的期間,要不要把債券 ETF 的單日劇烈波動,當成比平常更強的股市…
→