抽樣偏誤 是什麼?

Sampling Bias:抽樣偏誤 的完整解釋

資料收集過程中某些群體被系統性地過度或不足代表,導致樣本無法真實反映目標母體的問題。

抽樣偏誤的核心問題在於樣本對母體的代表性不足。在統計學的理想假設中,樣本應該是從目標母體中以隨機方式抽取的(即每個個體有相等且已知的被選取機率),但現實中許多資料收集情境都無法滿足這個假設,造成系統性的選取偏差。

常見的抽樣偏誤類型

  1. 自我選擇偏誤(Self-Selection Bias):調查或資料收集依賴個體自願參與,而自願參與者往往具有特定的動機或特徵,不能代表所有人。例如,網路評論只能反映極端滿意或極端不滿意的消費者,無法代表大多數有中性體驗的用戶。

  2. 存活者偏誤(Survivorship Bias):只對仍然存在(存活)的個體進行分析,忽略了已消失(失敗、退出)的個體,導致對成功率的過度樂觀估計。著名案例:二戰時分析返回飛機的彈孔分布來強化防護,但問題在於那些飛機「已經回來了」,應該分析的是沒有回來的飛機受損在哪裡。

  3. 確認偏誤(Confirmation Bias)在資料收集中的體現:研究者無意識地更傾向收集支持預設假設的資料,忽略反駁性資料。

  4. 選取偏誤(Selection Bias):研究設計本身決定了哪些個體可以進入研究,例如臨床試驗的入排標準可能排除了老年人或多重疾病患者,導致試驗結果難以推廣到真實患者群體。

  5. 歷史偏誤(Historical Bias)在機器學習中:使用過去的決策資料訓練模型,而過去的決策本身就存在歧視性選擇,例如歷史招聘資料中女性程式設計師被系統性低估錄用,用此資料訓練的 AI 招聘工具將延續這個偏見。

  6. 地理或平台偏誤:從特定平台或地理位置收集的資料,不一定能代表其他平台或地區的用戶。NLP 模型若主要用英文網路資料訓練,對低資源語言的效果通常較差。

對機器學習模型的影響

抽樣偏誤在機器學習中可以從以下幾個層面造成問題:

  • 模型效能差異化:模型在訓練集代表性足夠的群體上效果好,在代表性不足的群體上效果差,但整體指標可能掩蓋這種差距。
  • 強化既有不平等:偏斜的訓練資料讓模型「學會」了歷史上的不公平決策模式,並在部署後持續強化這些模式。
  • 泛化失敗:模型在測試集(與訓練集同偏誤)上表現良好,但在真實部署環境(不同分布)中表現下降。

偵測與緩解方法

  • 資料來源審計:記錄並分析資料的收集方式、時間、地點、來源平台,識別潛在的系統性選取問題。
  • 分層抽樣分析:將資料按人口屬性分層,比較各子群的樣本比例與已知母體比例是否一致。
  • 重新採樣(Resampling):對代表性不足的群體進行過採樣(Over-sampling),或對過度代表的群體進行欠採樣(Under-sampling)。
  • 樣本權重(Instance Weighting):對不同群體的樣本賦予不同的訓練權重,使模型學習更公平的分布。
  • 增加資料多樣性:主動從代表性不足的群體中收集更多資料,從根源解決問題。

大型語言模型訓練中的抽樣偏誤

LLM 的訓練語料同樣面臨嚴重的抽樣偏誤問題。網路爬取語料高度偏向英語、2020 年代前的資訊、西方文化視角、受過高等教育的寫作風格,以及網路上活躍的族群。這導致 LLM 在代表性不足的語言、文化、時期上的知識和能力明顯較弱。此外,網路語料包含大量虛假資訊、偏激言論,若未適當過濾,模型可能習得有害的偏見。負責任的 LLM 開發者應公開訓練資料的組成與過濾策略(如 Data Cards),讓外界能評估潛在的偏誤來源。

在 AI 系統審計中的重要性

政府與企業在採購或自建 AI 系統時,應要求供應商提供訓練資料的代表性分析文件(類似「資料卡」Data Card 或「模型卡」Model Card),記錄訓練資料的來源、時間範圍、人口組成比例,以及已知的代表性不足問題。這有助於評估 AI 系統在特定部署場景(如服務台灣在地用戶)中可能存在的抽樣偏誤風險,並在系統上線後設計對應的監控指標,確保不同用戶群體都能得到公平且準確的服務。

常見問題