116 萬筆選擇權交易只是一張地圖,不是那段市場
讀者互動
登入會員可按讚與收藏。
持續追蹤這項研究
收藏、追蹤與明日提醒只保存必要識別資料,可在會員中心檢視或刪除。
研究資訊不構成個人投資建議;提醒僅代表研究更新,不代表交易訊號。
一份資料有 1,161,488 筆交易 ,第一眼很難把它和「資料不夠」放在一起。
這次偏偏就是這種情況。
我們想問的是:散戶選擇權訂單進入短暫競價後,平常看得到的成交改善,到了市場高度緊張的日子還剩多少?公開檔裡確實有超過百萬筆紀錄,其中 384,580 筆屬於競價成交。可是,把交易筆數收回日曆上,只剩 16 個作者改造過的日期;拿前一個收盤日已知的市場恐慌指數去配,達到事前壓力門檻的日期是 0 個 。
百萬筆資料可以把某一天算得很細,卻不能憑空生出一個從未出現的市場狀態。
選擇權競價在做什麼
投資人送出一張選擇權訂單後,券商有時會讓它進入一個很短的電子競價。多家造市商可以在這段時間出價,投資人有機會拿到比原先報價更好的成交價格。
原始研究關心這套機制平均能不能改善成交。我們追問另一層:市場已經很緊張時,造市商可能縮手、報價可能變寬,平常的好處會不會縮小。
這兩個問題需要的資料不同。平均效果可以靠大量交易筆數估;壓力期是否改變效果,還得有足夠多個日期、足夠多個壓力日,以及足夠多個標的。這份公開檔只滿足了第一項。
116 萬筆,攤回日曆只剩 16 天
資料來自 Harvard Dataverse,授權為 CC0 1.0。作者已明確註記:這是為了公開程式流程而製作的縮小版資料,數值經過獨立擾動,標的匿名化,時間戳也和原始美國選擇權逐筆成交資料不同。它不能拿來重現論文中的市場結果。
公開檔的輪廓如下:
| 檢查項目 | 公開檔實際內容 |
|---|---|
| 全部交易列數 | 1,161,488 |
| 競價成交列數 | 384,580 |
| 競價成交占比 | 33.11% |
| 一般連續成交列數 | 776,908 |
| 不同日期 | 16 |
| 匿名標的 | 3 |
| 日期範圍 | 2020-09-18 至 2020-12-14 |
| 落在週末的日期 | 6(占 37.5%) |
最值得停下來看的,是最後四列。1,161,488 筆交易集中在 16 個日期,平均每個日期有很多筆,但能用來比較市場狀態的日子仍然只有 16 個。三個匿名標的也無法告訴我們,結果能否跨到更多股票。
六個日期落在週末,進一步提醒我們:這些日期是作者改造後的標記,不能當成真實交易日曆。它們適合檢查程式能否讀檔、分組與加總,不適合貼回歷史市場敘事。
四道資料門,一道都沒開
分析開跑前先寫好四個最低條件。任何一項未過,就停止正式比較,不把描述數字包裝成壓力期證據。
| 事前條件 | 最低要求 | 實際值 | 結果 |
|---|---|---|---|
| 不同日期 | 至少 80 個 | 16 個 | 未過 |
| 高壓力日期 | 至少 30 個 | 0 個 | 未過 |
| 不同標的 | 至少 10 個 | 3 個 | 未過 |
| 週末日期 | 必須為 0 個 | 6 個 | 未過 |

市場狀態的配對也刻意避開偷看。每個日期只使用前一個收盤日已知的恐慌指數;當天收盤後才知道的數值沒有進入訊號。這 16 個日期對到的數值介於 22.52 到 26.46 ,中位數 25.00 。固定壓力線是 30.00 ,所以高壓力日期仍是 0 個。
時間順序處理正確,只能排除「拿未來資訊解釋過去」這個錯誤。它補不了樣本裡缺少壓力日的事實。
那三根紫色柱子能告訴我們什麼
公開檔仍然可以做描述性加總。把全部改造後的交易合在一起,競價成交相對一般成交的平均差異如下:
| 公開檔中的描述值 | 競價成交相對差異 |
|---|---|
| 價格改善增加 | 4.9088 美分 |
| 有效價差降低 | 5.2418 美分 |
| 成交品質比率降低 | 0.3957 |
| 競價中出現多位出價者的比率 | 5.0705% |

這些值採全部可用交易列合併計算,各日期沒有先調成相同權重。更重要的是,數值來自經過擾動的公開檔。它們能檢查加總流程與圖表是否一致,不能充當真實市場的報酬或成交品質估計。
正式的壓力期比較完全沒有執行,因此也沒有可報告的統計強度或勝負判定。表格裡的正數看起來像競價較好,讀者仍不能把它延伸成「高度緊張時也有效」。樣本裡根本沒有高度緊張的日期可比。
這次可以下的結論很窄
這份公開檔不足以回答「競價好處在市場壓力下會維持還是縮小」。四道事前資料門全部未過,分析依規則停在正式比較之前。
因此,以下兩句都沒有證據支持:
- 市場緊張時,競價好處依然存在。
- 市場緊張時,競價好處會消失。
目前能確認的只有資料邊界。公開檔很大,但日期、壓力狀態、標的廣度與交易日曆都不符合這個問題的最低需求。
為什麼「幾筆資料」常會騙人
一百萬筆看起來比一百筆可靠,前提是研究問題也活在「每一筆交易」這個層級。若問題改成「不同市場狀態之間有沒有差」,真正有用的單位會變成日期或事件。
想像你拿到一座球場同一天的十萬張座位照片。你可以很精確地數出那天有多少空位,卻無法靠這十萬張照片比較晴天與雨天的進場率。要做後一題,需要更多天氣不同的比賽日。
這份選擇權資料面對的是同一個限制。交易列數回答「這些改造日期裡有多少筆」,壓力期問題需要「有多少個彼此不同、而且真的跨過壓力線的日期」。兩個分母差了好幾層。
什麼條件下可以重開
重開不需要改研究問題,也不該降低門檻。需要的是一份保留真實交易日與標的身分、可合法使用的選擇權樣本,並同時滿足:
- 至少 80 個不同交易日;
- 至少 30 個前一日恐慌指數達 30 或以上的壓力日;
- 至少 10 個不同標的;
- 沒有週末偽日期。
屆時仍沿用前一個收盤日的恐慌指數,避免使用當天尚未知道的資訊。四道門全開之後,才估計競價和市場壓力一起出現時,成交改善到底改變多少。
在那之前,最誠實的答案就是「資料尚未涵蓋這個問題」。
下次看到一份號稱有幾百萬列的大資料,先別只問列數。再問四件事:跨了幾個日期、包含幾種關鍵狀態、涵蓋幾個標的、時間戳能不能當真。這四個答案,往往比檔案大小更接近研究品質。
資料來源 :Khan、Hendershott 與 Riordan,〈Option Auctions〉,Review of Financial Studies 39(3), 783–834;Harvard Dataverse 公開資料,DOI 10.7910/DVN/LMB13N,CC0 1.0。市場壓力序列取自 Federal Reserve Bank of St. Louis FRED VIXCLS,凍結檔涵蓋 2020-08-01 至 2020-12-31;本文只把前一個收盤日已知的數值配到作者改造後的 2020-09-18 至 2020-12-14 日期標籤。所有數字逐項讀自經審查的結果檔;結果檔為保持逐位元重現,刻意不寫執行當下時間。
懶人包圖組


