主動學習 是什麼?

Active Learning:主動學習 的完整解釋

一種機器學習策略,由演算法主動選擇最具訊息價值的未標籤樣本進行標籤,以最小化標籤成本並最大化模型性能

核心概念

主動學習解決的是機器學習中的核心難題:標籤資料成本高昂。在許多實務應用中,收集原始資料容易(如網路爬蟲、感測器),但對資料進行人工標籤耗時耗力。醫學影像診斷需要放射科醫生標籤,文本分類需要領域專家標籤,品質檢測需要人工檢驗。主動學習的核心思想是:與其被動地標籤隨機樣本,不如讓演算法主動選出「最能幫助模型改進」的樣本進行標籤。

主動學習與被動學習的根本差異在於標籤策略。被動學習假設訓練資料是隨機分布的,直接進行標籤。主動學習則利用模型的不確定性或邊界資訊,優先標籤那些模型最困惑、最可能改進的樣本。

運作原理

主動學習的典型工作流程分為三個環節:

  • 初始化階段:從未標籤的資料池中隨機選擇少量樣本進行標籤,訓練初始模型。

  • 查詢階段:演算法基於某種評分函數,計算未標籤樣本的「訊息價值」,排序後選出最有價值的樣本。

  • 標籤與更新階段:人工對選中的樣本進行標籤,將其加入訓練集,重新訓練模型。重複以上過程直到達到性能目標或標籤預算耗盡。

主要查詢策略:

  • 不確定性採樣(Uncertainty Sampling):選擇模型預測置信度最低的樣本。對於分類任務,可以選擇預測概率最接近 0.5 的樣本(模型最困惑的);對於迴歸任務,可以選擇預測方差最高的樣本。這是最簡單和最常用的策略。

  • 查詢由分歧(Query by Committee):訓練多個模型(委員會),選擇委員會成員預測分歧最大的樣本。這個策略基於這樣的假設:如果多個模型對某個樣本的預測高度不一致,這個樣本一定包含豐富的訊息。

  • 預期誤差減少(Expected Error Reduction):選擇能最大化預期泛化性能提升的樣本。這要求對每個候選樣本進行假設標籤,計算如果標籤該樣本模型性能會提升多少。計算成本高,但效果最好。

  • 多樣性採樣(Diversity Sampling):不僅考慮訊息價值,還考慮樣本多樣性。如果選出的樣本都聚集在特定特徵空間,則資訊冗餘;應該選擇既有訊息價值又能覆蓋不同特徵空間的樣本。

實際應用

  • 醫療影像診斷:放射科影像(X 光、CT、MRI)的標籤成本極高。醫院可以用主動學習先訓練初始診斷模型,然後系統自動標記「最難判斷」的影像由放射科醫生確認,逐步改進模型。這樣可以減少 50-70% 的標籤工作量。

  • 自然語言處理:文本分類、命名實體識別、情感分析等都需要大量標籤資料。應用主動學習可以優先標籤模型最困惑的句子,如邊界情況和新穎表達方式。

  • 垃圾郵件檢測:新型垃圾郵件不斷出現,需要持續更新模型。主動學習可以優先標籤模型預測不確定、可能是新型垃圾郵件的郵件。

  • 品質控制:製造業中的產品缺陷檢測可以用主動學習減少人工檢驗工作。系統學習初期,對於邊界產品(接近合格/不合格判斷線)優先進行人工檢驗。

  • 推薦系統的冷啟動:新用戶或新商品時,主動學習可以優先向用戶查詢最具區分度的商品偏好(如問「你喜歡 A 類商品還是 B 類」),快速建立用戶檔案。

常見誤區

  • 誤區 1:主動學習總是比被動學習好。主動學習的優勢體現在「標籤成本」優化上,但並非在所有場景都成立。如果標籤成本忽略不計,或資料分布非常均衡,被動隨機標籤可能足夠。

  • 誤區 2:主動學習無需初始訓練資料。實際上主動學習需要初始的標籤資料來訓練初始模型,生成置信度估計。沒有初始模型,無法判斷哪些樣本最有價值。

  • 誤區 3:主動學習一定會進入局部最優陷阱。雖然初期集中標籤不確定樣本有風險,但結合多樣性採樣或查詢由分歧策略,可以平衡局部深度和全局廣度。

  • 誤區 4:人工標籤一定正確。在實務中,人工標籤也會出錯(如醫療診斷的誤診)。主動學習系統需要容納「標籤雜訊」。

與相關技術的比較

  • 主動學習 vs. 被動學習:被動學習隨機標籤,主動學習基於訊息價值選擇性標籤。主動學習在標籤預算有限的場景效率更高,但計算複雜度更高。

  • 主動學習 vs. 半監督學習:半監督學習利用未標籤資料的分布資訊來改進模型,但不涉及選擇性標籤。主動學習是「主動選擇」要標籤的樣本,可以與半監督學習結合。

  • 主動學習 vs. 強化學習:強化學習通過與環境互動獲得獎勵訊號。主動學習的查詢策略類似強化學習的探索策略,都尋求最高訊息價值的動作。區別在於主動學習用於有監督的標籤任務,強化學習用於無直接標籤的決策任務。

  • 主動學習 vs. 遷移學習:遷移學習利用預訓練的知識減少標籤需求,主動學習基於不確定性選擇性標籤。兩者都解決標籤稀缺問題,但方向不同。實踐中常結合使用。

常見問題