搜尋意圖: 如果你在找「不確定性抽樣 是什麼」或「不確定性抽樣 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 在主動學習中選擇模型預測信心度最低的樣本進行標籤,以優先改進模型的薄弱決策邊界。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
在主動學習中選擇模型預測信心度最低的樣本進行標籤,以優先改進模型的薄弱決策邊界。
核心概念
不確定性抽樣奠基於一個簡單但有力的觀察:機器學習模型的預測錯誤集中在決策邊界。當一個模型給出 51% 的概率時,相比 99% 的概率,它更可能出錯。標籤決策邊界附近的樣本比標籤確定區域的樣本更能改進模型。
這裡的「不確定性」有多種定義方式。對於分類任務,最常見的是:
- 熵:預測概率分佈的熵,值越高表示模型越不確定
- 邊際值:最高預測概率與次高概率的差距,差距越小越不確定
- 最高概率差異:模型最高預測概率距離 0.5 的距離,越接近 0.5 越不確定
對於迴歸任務,不確定性可以用預測的標準差、貝葉斯模型的後驗分布寬度,或集成方法中不同模型預測的分歧程度。
運作原理
不確定性抽樣的實現流程直接明了:
- 用現有標籤資料訓練模型,取得初代模型
- 對所有未標籤樣本進行預測,計算每筆的預測不確定性
- 選擇不確定性最高的 K 筆樣本
- 將這 K 筆樣本提交給標籤師標籤
- 將新標籤加入訓練集,重新訓練模型
- 重複上述流程直到預算用盡或性能飽和
選擇哪個不確定性度量很關鍵。熵度量提供全局不確定性視角,對多分類問題敏感;邊際值度量更直接反映二分類決策的自信度;最高概率則最容易實現且對嘈雜模型輸出的魯棒性強。
實務中常見的做法是結合多個度量,例如先用熵篩出高不確定性前 10% 的樣本,再在這個子集中用邊際值排序,最終選擇最頂端的。
實際應用
在垃圾郵件過濾中,初期訓練資料有 500 封標籤郵件。郵件分類器對大部分郵件預測信心很高(99% 正常郵件 / 99% 垃圾郵件),但對某些混合特徵的郵件預測概率在 45%-55% 間徘徊(如公司通知但含銷售性質)。系統自動識別這 2% 的邊界郵件並請標籤師判斷,這些郵件的標籤改進了垃圾分類的邊界定義。
在語音識別中,模型通常對清晰口音有很高信心(99% 準確度),但對口音混雜或背景雜音的語句信心下降到 60%-80%。不確定性抽樣會優先選擇模型預測信心在 60%-80% 的音檔給人類標籤員審聽,而自動跳過已非常確定的音檔。
在信用評分模型中,銀行需要標籤數千個客戶的信用等級。不確定性抽樣會優先選擇「模型預測介於風險邊界」的客戶檔案(如信用分數在 580-620 之間),這些案例往往涉及非標準情況(如收入波動、短期大額支出),標籤師的人工判斷有最高價值。
常見誤區
誤區一:高不確定性等於高價值。事實上,模型的高不確定性有時反映資料品質問題或分佈外異常值,而非決策邊界。例如,掃描影像中的嚴重干擾會讓模型輸出完全隨機(高熵),但標籤這類有缺陷的樣本無助於改進模型。應該加入品質檢查,過濾明顯異常或損壞的樣本。
誤區二:只用單個不確定性度量。實務中,不同度量的選擇會導致迥異的選樣結果。使用熵時可能偏好多分類邊界,用邊際值時可能傾向二分類邊界。最穩健的做法是監控不同度量的一致性,或結合多個度量進行投票。
誤區三:假設不確定性抽樣對所有模型類型都同樣有效。實際上,某些模型(如樹型模型)的預測概率校準很差,給出的不確定性估計不可信。應該先驗證模型的校準程度(用可靠性圖或 expected calibration error),必要時採用貝葉斯方法或非參數方法來改進不確定性估計。
與相關技術的比較
- 不確定性抽樣 vs. 多樣性抽樣:不確定性聚焦決策邊界,多樣性聚焦資料空間覆蓋。不確定性易陷入邊界局部最優(例如邊界出現聚集時重複標籤類似樣本),多樣性可補缺,但多樣性邊界樣本可能冗餘。結合兩者效果最佳。
- 不確定性抽樣 vs. 委員會查詢:委員會用多模型意見分歧衡量不確定性,較複雜但更穩健。不確定性抽樣更簡單,但對單一模型的預測校準依賴強。資源充足時委員會更佳。
- 不確定性抽樣 vs. 預期模型改進:預期改進直接估計標籤該樣本對全局性能的提升,理論上最優。但計算複雜度高。不確定性抽樣是快速代理,在預算和計算限制下常是更實用的選擇。
- 不確定性抽樣 vs. 隨機抽樣:隨機抽樣無偏但低效,需要更多標籤達到相同性能。不確定性抽樣減少標籤需求 50%-80%,在標籤成本高的場景優勢明顯。
常見問題
如何判斷模型的不確定性估計是否可靠?
需要驗證模型的校準程度。一個校準良好的分類模型應該滿足:當模型輸出 90% 概率時,該預測實際正確率約 90%;輸出 50% 時,實際正確率約 50%。可以用可靠性圖(reliability diagram)視覺化評估,或計算 expected calibration error(ECE)和 maximum calibration error(MCE)。若 ECE > 0.15,模型校準效果不佳,直接用其輸出概率估計不確定性會導致抽樣偏差。此時應考慮溫度調整、Platt scaling 或 isotonic regression 等校準技術。
多分類和二分類問題的不確定性抽樣有何區別?
二分類可用邊際值(最高概率減次高概率)直接衡量邊界到決策線的距離,直觀有效。多分類時,邊際值可能不足以反映類別間的複雜決策邊界。此時熵度量通常更好,因為它考慮所有類別的概率分佈。例如,3 分類問題中 (90%, 5%, 5%) 的邊際值相同但不確定性小於 (33%, 33%, 33%)。另外,多分類時應特別注意類別不平衡問題,不確定性抽樣可能過度選擇少數類,需要加上多樣性約束。
不確定性抽樣遇到標籤預算小但資料量大的情況如何處理?
面對百萬級未標籤資料但只有千級標籤預算的場景,計算所有樣本的不確定性也是瓶頸。實務做法是分階段抽樣:第一階段用快速粗篩(如 k-means 抽樣或預訓練模型特徵距離)篩出 10-20 倍預算大小的候選池,第二階段在這個候選池內計算精確不確定性並排序。或者採用動態抽樣,每輪用當前模型計算不確定性時,只評估最近新增的未標籤樣本和邊界附近樣本,節省計算。大規模場景下,粗篩 + 精篩的二階段方法通常是成本與效果的最佳平衡。