Survivorship Bias(倖存者偏誤)
倖存者偏誤指一組資料的樣本是被結果篩選出來的,於是它支持得了「這件事發生過」,支持不了「照做會有多大機會發生」。它跟資料品質無關——每一筆數字都可以是真的,問題出在誰進得了這份名單。拿一組同業的營業利益率當標準、或引用一個「產業正常值」時,它是最常被略過的一項檢查,因為缺席的那些不會在任何一張表上留下空格。
失真的方向由「缺席那件事」與「這次要平均的那個量」之間的相關方向決定,不由退出的原因決定。 退出原因是推斷那個相關的證據,不是它的替身:同一批倒閉的公司,在利潤率上移除的是低端、留存樣本因此偏高,在負債比上移除的卻是高槓桿的那些、留存樣本看起來反而財務保守。換一個指標,同一批缺席者的失真方向就換一次。
概念位置
它是跨公司比較的前置檢查,順序在算比率之前——毛利率、營業利益率、ROE 本身沒有問題,被污染的是拿來當對照的那組同業名單。
跟兩張鄰卡的分工要分清楚。Normalized Earnings(正常化盈餘)修的是同一家公司的時間軸——剔除一次性損益,讓不同年度可比;倖存者偏誤修的是同一時點的橫斷面——名單裡少了誰。公司公開程度則說明缺席的機制之一:揭露義務跟著交易狀態走,下市之後就不再有公開財報。
可觀察訊號與例子
下面四種是本卡從站內既有分析與公開討論裡歸納的、最常遇到的篩選位置。它們不窮盡,而且這份清單自己也是被結果篩過的:沒有被任何人指認過的篩選機制,依同一條判準不會出現在任何一份談倖存者偏誤的材料上,也就進不了這裡。所以它說明得了這些形態長什麼樣,說明不了它們涵蓋實際失真的多大比例。
產業基準的名單由揭露義務決定:公開資料只收仍在營運的公司,退出的不在比較組裡。換成中位數會縮小損害而不消除它。差別在兩者對「少掉一群」的反應方式:中位數只是往名單中間的位置挪,挪多少大約是缺席比例的一半;平均則被整群的差距拉著走,缺席那群跟留下來的差多少就拉多少,沒有上限。兩邊都有人退出而人數相當時,中位數幾乎不動而平均照樣偏。產業基準分析有一節處理它在比較組建構上的形態。
社群數據與加盟說明會的關卡是「誰願意被看見」,而兩者的機制不同:社群上分享經營數據的通常是還在營運的經營者,收掉的不會來發文,那是自我選擇;加盟說明會展示的是主辦方挑出來的最佳情境而非分佈,那是對方替你選樣。加盟早餐店的完整案例在單店層級查不到可比的公開財報,能用的來源只剩社群數據、加盟說明會與同業觀察,是這個形態最完整的實例。
歷史報酬的回測(用歷史資料模擬一套買賣規則過去的績效)被資料源的維護方式篩過,而這是選擇不是結構必然:以「目前有在交易的證券」為維護單位的資料源,一檔下市之後沒有價格可更新就從當期名單消失,而專業級的資料庫提供每個歷史時點當時的成分名單與下市當期報酬(縮小而不歸零)。用前者回推二十年前的組合,當年買得到而現在不在名單上的那些不會出現,回測照樣跑得完、曲線照樣平滑。
跨國或跨世紀的長序列的樣本由分析者挑:挑的是某個沒有中斷過的市場,中斷過的(國有化、關閉、惡性通膨把實質本金侵蝕殆盡)不進序列;起點年挑在低點,整段的年化報酬跟著被抬高。長度不解決這個問題——估市場中斷的機率時,一百年的單一市場資料是一個樣本而不是一百個。
這四種都篩在退出端,而篩選也會發生在進入端:只有績效好的基金被補進資料庫、連同過去的歷史一起補進來,或公司挑在景氣高峰掛牌。兩端的判讀共用同一條相關性判準,差別在缺席的是後來離開的那些、還是從頭就沒進來的那些。
判讀方式
三步,順序不能換:誰缺席了、這次要平均的是哪個量、缺席者在那個量上落在哪一端。第三步才是方向,前兩步是推它的材料。退出原因(倒閉、被併購、私有化、經營者屆齡收手、分拆、借殼、產業重分類)在這裡的用途是推斷第三步,本身不決定方向——同一個「被併購」標籤下,付溢價買成長的挑走的是上端,撿殘值的挑走的是下端。
這三步只在單一機制主導時交付一個方向;兩種機制勢均力敵時定不出來,那時該把宣稱往兩邊都放寬成區間,不是挑一邊。
方向定了才輪到幅度。怎麼估、估不出來時那組數字降成什麼用、以及哪一類看起來像穩健性檢查的動作其實驗不到這個偏誤,寫在 倖存者偏誤的幅度估計。
機制型的宣稱限定範圍後仍然可用。 一份用五家公司講清楚組織改造要動哪幾個部件的報告,那份清單不因為五家都成功而失效,失效的是接下來那句「因此這套做法可行」。
比率與基準率型的宣稱不同:一個「產業正常值」的用途本身就是當目標或當機率,把它限定成「存活者的平均」等於刪掉它的用途。估不出缺席者的分佈時,那個數字降級成一個界(往哪一邊由方向決定、哪些結論還撐得住,見幅度篇),或換一個不靠名冊的來源。對方知道你要拿去做什麼而挑出來的樣本更極端,限定範圍救不了。
反過來把它當成套在任何資料上的否決規則同樣有代價:以自願參與或持續存續為收錄條件的資料,多半找得到某種自我選擇,當成否決條件用會擋掉大部分分析。法定強制申報的普查與行政母體資料不在此列,那是這條反向誤用的邊界。
同一條判準對書也成立,只是那時篩選發生在出版這一關,形態寫在 證據來源分類。