不確定性抽樣 是什麼?

Uncertainty Sampling:不確定性抽樣 的完整解釋

在主動學習中選擇模型預測信心度最低的樣本進行標籤,以優先改進模型的薄弱決策邊界。

核心概念

不確定性抽樣奠基於一個簡單但有力的觀察:機器學習模型的預測錯誤集中在決策邊界。當一個模型給出 51% 的概率時,相比 99% 的概率,它更可能出錯。標籤決策邊界附近的樣本比標籤確定區域的樣本更能改進模型。

這裡的「不確定性」有多種定義方式。對於分類任務,最常見的是:

  • 熵:預測概率分佈的熵,值越高表示模型越不確定
  • 邊際值:最高預測概率與次高概率的差距,差距越小越不確定
  • 最高概率差異:模型最高預測概率距離 0.5 的距離,越接近 0.5 越不確定

對於迴歸任務,不確定性可以用預測的標準差、貝葉斯模型的後驗分布寬度,或集成方法中不同模型預測的分歧程度。

運作原理

不確定性抽樣的實現流程直接明了:

  • 用現有標籤資料訓練模型,取得初代模型
  • 對所有未標籤樣本進行預測,計算每筆的預測不確定性
  • 選擇不確定性最高的 K 筆樣本
  • 將這 K 筆樣本提交給標籤師標籤
  • 將新標籤加入訓練集,重新訓練模型
  • 重複上述流程直到預算用盡或性能飽和

選擇哪個不確定性度量很關鍵。熵度量提供全局不確定性視角,對多分類問題敏感;邊際值度量更直接反映二分類決策的自信度;最高概率則最容易實現且對嘈雜模型輸出的魯棒性強。

實務中常見的做法是結合多個度量,例如先用熵篩出高不確定性前 10% 的樣本,再在這個子集中用邊際值排序,最終選擇最頂端的。

實際應用

在垃圾郵件過濾中,初期訓練資料有 500 封標籤郵件。郵件分類器對大部分郵件預測信心很高(99% 正常郵件 / 99% 垃圾郵件),但對某些混合特徵的郵件預測概率在 45%-55% 間徘徊(如公司通知但含銷售性質)。系統自動識別這 2% 的邊界郵件並請標籤師判斷,這些郵件的標籤改進了垃圾分類的邊界定義。

在語音識別中,模型通常對清晰口音有很高信心(99% 準確度),但對口音混雜或背景雜音的語句信心下降到 60%-80%。不確定性抽樣會優先選擇模型預測信心在 60%-80% 的音檔給人類標籤員審聽,而自動跳過已非常確定的音檔。

在信用評分模型中,銀行需要標籤數千個客戶的信用等級。不確定性抽樣會優先選擇「模型預測介於風險邊界」的客戶檔案(如信用分數在 580-620 之間),這些案例往往涉及非標準情況(如收入波動、短期大額支出),標籤師的人工判斷有最高價值。

常見誤區

誤區一:高不確定性等於高價值。事實上,模型的高不確定性有時反映資料品質問題或分佈外異常值,而非決策邊界。例如,掃描影像中的嚴重干擾會讓模型輸出完全隨機(高熵),但標籤這類有缺陷的樣本無助於改進模型。應該加入品質檢查,過濾明顯異常或損壞的樣本。

誤區二:只用單個不確定性度量。實務中,不同度量的選擇會導致迥異的選樣結果。使用熵時可能偏好多分類邊界,用邊際值時可能傾向二分類邊界。最穩健的做法是監控不同度量的一致性,或結合多個度量進行投票。

誤區三:假設不確定性抽樣對所有模型類型都同樣有效。實際上,某些模型(如樹型模型)的預測概率校準很差,給出的不確定性估計不可信。應該先驗證模型的校準程度(用可靠性圖或 expected calibration error),必要時採用貝葉斯方法或非參數方法來改進不確定性估計。

與相關技術的比較

  • 不確定性抽樣 vs. 多樣性抽樣:不確定性聚焦決策邊界,多樣性聚焦資料空間覆蓋。不確定性易陷入邊界局部最優(例如邊界出現聚集時重複標籤類似樣本),多樣性可補缺,但多樣性邊界樣本可能冗餘。結合兩者效果最佳。
  • 不確定性抽樣 vs. 委員會查詢:委員會用多模型意見分歧衡量不確定性,較複雜但更穩健。不確定性抽樣更簡單,但對單一模型的預測校準依賴強。資源充足時委員會更佳。
  • 不確定性抽樣 vs. 預期模型改進:預期改進直接估計標籤該樣本對全局性能的提升,理論上最優。但計算複雜度高。不確定性抽樣是快速代理,在預算和計算限制下常是更實用的選擇。
  • 不確定性抽樣 vs. 隨機抽樣:隨機抽樣無偏但低效,需要更多標籤達到相同性能。不確定性抽樣減少標籤需求 50%-80%,在標籤成本高的場景優勢明顯。

常見問題