標籤分布漂移 是什麼?

Label Drift:標籤分布漂移 的完整解釋

標籤分布漂移(Label Drift)指模型在生產環境中遭遇的目標變數(標籤)分布與訓練時不同的現象,例如詐欺偵測中詐欺案件占比從 1% 升至 5%,導致原本校準好的模型閾值和效能指標失效,需觸發再訓

核心概念

機器學習模型是在特定時間點的訓練資料上建立的,其學習到的決策邊界隱含了訓練資料的標籤分布假設。當現實世界的標籤分布發生改變,這些假設不再成立,即使模型在歷史資料上表現良好,在新資料上的效能也可能顯著下降。

標籤漂移(Label Drift)也稱為概念漂移的一個子類型,需與以下術語區分:

  • 特徵漂移(Covariate Drift / Feature Drift):輸入特徵的分布 P(x) 改變,但 P(y|x) 不變
  • 概念漂移(Concept Drift):P(y|x) 改變,即相同特徵下標籤的含義改變(更根本的問題)
  • 標籤漂移(Label Drift):標籤的邊際分布 P(y) 改變,P(y|x) 可能不變

標籤漂移通常比特徵漂移更難偵測,因為取得生產環境的真實標籤需要時間和人工標注,而生產環境的輸入特徵是即時可觀測的。

運作原理

為何標籤漂移影響模型效能?

以詐欺偵測為例說明:

訓練期:資料集中詐欺比例為 1%(99% 正常交易),模型以最大化 F1 分數為目標,學習到決策閾值為 0.7,在驗證集上精確率 90%、召回率 85%。

生產期:由於新型詐欺手法擴散,詐欺比例上升至 10%。此時:

  • 使用原始閾值 0.7,模型的召回率上升但精確率下降(更多真實詐欺超過閾值,但假警報也增加)
  • 若模型使用了類別權重(class weight),訓練時的 1:99 比例假設不再適合 1:9 的生產環境
  • 評估指標若依然以原始驗證集計算,無法反映實際效能

概念漂移 vs 標籤漂移

更嚴重的情況是概念漂移:詐欺手法改變,使得相同特徵組合下交易性質發生改變(之前是詐欺特徵,現在詐欺者改用正常行為模式)。概念漂移意味著 P(y|x) 本身改變,模型學習到的映射關係失效,必須重新訓練。

純標籤漂移(P(y) 改變但 P(y|x) 不變)理論上可透過調整決策閾值或後驗機率校準(Probability Calibration)來適應,無需完全重新訓練。

偵測方法

  1. 監控生產標籤統計量

若能以可接受的延遲收集生產標籤(如次日批次標注、用戶反饋信號),可直接比較訓練集和近期生產資料的標籤分布,計算 JSD、卡方檢定(Chi-Square Test)或 PSI(Population Stability Index)。

  1. 代理指標監控

當真實標籤延遲時,可監控代理指標(Proxy Metric):例如詐欺系統中的「用戶爭議率」、醫療診斷中的「複診率」等,作為標籤漂移的早期預警信號。

  1. 預測分數分布監控

即使沒有真實標籤,若模型對生產資料的正類預測分數分布顯著改變,也可能反映標籤分布的改變。例如,模型對某時期資料的平均預測分數從 0.05 上升至 0.15,可能代表正類樣本增多。

實際應用

金融詐欺偵測

詐欺行為模式隨攻防演化持續改變,標籤(是否詐欺)的分布也因此動態變化。線上支付平台需持續監控詐欺率,並在漂移超過閾值時觸發模型再訓練或閾值調整。

信用評分

經濟景氣改變時,違約率(標籤)的基準比例改變。若訓練於景氣期的模型在衰退期部署,低違約率的先驗假設不再成立,模型可能系統性地低估違約風險。

內容審核

社群媒體平台中,違規內容(仇恨言論、詐騙帖文)的比例會因社會事件、政策變化而劇烈波動,內容審核模型需要持續監控標籤分布並動態調整。

醫療診斷

疾病季節性爆發(如流感季、COVID-19 疫情)使某些診斷的陽性率急劇上升,若 AI 診斷輔助系統使用的是年均陽性率訓練的模型,在爆發期的閾值設定可能不再合適。

常見誤區

誤區一:特徵監控足夠,不需要標籤監控

特徵漂移和標籤漂移可以獨立發生。只監控特徵分布無法偵測到「特徵未變但標籤分布改變」的情況(如疫情導致陽性率上升,但患者的症狀特徵分布沒有顯著變化)。完整的 MLOps 監控必須同時涵蓋特徵漂移和標籤漂移兩個維度。

誤區二:發現標籤漂移就必須立即重新訓練

標籤漂移不一定需要完整的重新訓練。若確認是純標籤漂移(P(y|x) 未變),可透過以下較低成本的方式應對:調整決策閾值(使用新的標籤比例校準)、更新類別權重(在不重新訓練的情況下調整模型的類別偏好),或進行後驗機率校準(Platt Scaling、Isotonic Regression)。只有確認是概念漂移時,才必須以新資料重新訓練。

誤區三:標籤收集延遲使標籤漂移無法偵測

即使生產標籤有延遲,仍有多種間接偵測手段:監控預測分數分布、使用代理指標、對高置信度預測進行抽樣人工審核、追蹤 PSI 指標等。完全等待真實標籤回流再偵測的策略反應過慢,現代 MLOps 平台通常結合多種信號建立早期預警機制。

與相關技術的比較

漂移類型 改變的分布 偵測難度 應對方法
特徵漂移(Covariate Drift) P(x) 低(特徵即時可見) 特徵分布監控、PSI
標籤漂移(Label Drift) P(y) 中(標籤延遲) 代理指標、延遲標籤監控
概念漂移(Concept Drift) P(y x) 高(需收集標籤才能確認)
先驗漂移(Prior Probability Shift) P(y) 閾值調整、機率校準

常見問題