主動學習(Active Learning)是什麼?

一種機器學習策略,由演算法主動選擇最具訊息價值的未標籤樣本進行標籤,以最小化標籤成本並最大化模型性能|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Active Learning
主題標籤
機器學習、資料處理、最佳化
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
主動學習(Active Learning)是什麼? 機器學習資料處理
術語快查

搜尋意圖: 如果你在找「主動學習 是什麼」或「主動學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 一種機器學習策略,由演算法主動選擇最具訊息價值的未標籤樣本進行標籤,以最小化標籤成本並最大化模型性能

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

一種機器學習策略,由演算法主動選擇最具訊息價值的未標籤樣本進行標籤,以最小化標籤成本並最大化模型性能

核心概念

主動學習解決的是機器學習中的核心難題:標籤資料成本高昂。在許多實務應用中,收集原始資料容易(如網路爬蟲、感測器),但對資料進行人工標籤耗時耗力。醫學影像診斷需要放射科醫生標籤,文本分類需要領域專家標籤,品質檢測需要人工檢驗。主動學習的核心思想是:與其被動地標籤隨機樣本,不如讓演算法主動選出「最能幫助模型改進」的樣本進行標籤。

主動學習與被動學習的根本差異在於標籤策略。被動學習假設訓練資料是隨機分布的,直接進行標籤。主動學習則利用模型的不確定性或邊界資訊,優先標籤那些模型最困惑、最可能改進的樣本。

運作原理

主動學習的典型工作流程分為三個環節:

  • 初始化階段:從未標籤的資料池中隨機選擇少量樣本進行標籤,訓練初始模型。

  • 查詢階段:演算法基於某種評分函數,計算未標籤樣本的「訊息價值」,排序後選出最有價值的樣本。

  • 標籤與更新階段:人工對選中的樣本進行標籤,將其加入訓練集,重新訓練模型。重複以上過程直到達到性能目標或標籤預算耗盡。

主要查詢策略:

  • 不確定性採樣(Uncertainty Sampling):選擇模型預測置信度最低的樣本。對於分類任務,可以選擇預測概率最接近 0.5 的樣本(模型最困惑的);對於迴歸任務,可以選擇預測方差最高的樣本。這是最簡單和最常用的策略。

  • 查詢由分歧(Query by Committee):訓練多個模型(委員會),選擇委員會成員預測分歧最大的樣本。這個策略基於這樣的假設:如果多個模型對某個樣本的預測高度不一致,這個樣本一定包含豐富的訊息。

  • 預期誤差減少(Expected Error Reduction):選擇能最大化預期泛化性能提升的樣本。這要求對每個候選樣本進行假設標籤,計算如果標籤該樣本模型性能會提升多少。計算成本高,但效果最好。

  • 多樣性採樣(Diversity Sampling):不僅考慮訊息價值,還考慮樣本多樣性。如果選出的樣本都聚集在特定特徵空間,則資訊冗餘;應該選擇既有訊息價值又能覆蓋不同特徵空間的樣本。

實際應用

  • 醫療影像診斷:放射科影像(X 光、CT、MRI)的標籤成本極高。醫院可以用主動學習先訓練初始診斷模型,然後系統自動標記「最難判斷」的影像由放射科醫生確認,逐步改進模型。這樣可以減少 50-70% 的標籤工作量。

  • 自然語言處理:文本分類、命名實體識別、情感分析等都需要大量標籤資料。應用主動學習可以優先標籤模型最困惑的句子,如邊界情況和新穎表達方式。

  • 垃圾郵件檢測:新型垃圾郵件不斷出現,需要持續更新模型。主動學習可以優先標籤模型預測不確定、可能是新型垃圾郵件的郵件。

  • 品質控制:製造業中的產品缺陷檢測可以用主動學習減少人工檢驗工作。系統學習初期,對於邊界產品(接近合格/不合格判斷線)優先進行人工檢驗。

  • 推薦系統的冷啟動:新用戶或新商品時,主動學習可以優先向用戶查詢最具區分度的商品偏好(如問「你喜歡 A 類商品還是 B 類」),快速建立用戶檔案。

常見誤區

  • 誤區 1:主動學習總是比被動學習好。主動學習的優勢體現在「標籤成本」優化上,但並非在所有場景都成立。如果標籤成本忽略不計,或資料分布非常均衡,被動隨機標籤可能足夠。

  • 誤區 2:主動學習無需初始訓練資料。實際上主動學習需要初始的標籤資料來訓練初始模型,生成置信度估計。沒有初始模型,無法判斷哪些樣本最有價值。

  • 誤區 3:主動學習一定會進入局部最優陷阱。雖然初期集中標籤不確定樣本有風險,但結合多樣性採樣或查詢由分歧策略,可以平衡局部深度和全局廣度。

  • 誤區 4:人工標籤一定正確。在實務中,人工標籤也會出錯(如醫療診斷的誤診)。主動學習系統需要容納「標籤雜訊」。

與相關技術的比較

  • 主動學習 vs. 被動學習:被動學習隨機標籤,主動學習基於訊息價值選擇性標籤。主動學習在標籤預算有限的場景效率更高,但計算複雜度更高。

  • 主動學習 vs. 半監督學習:半監督學習利用未標籤資料的分布資訊來改進模型,但不涉及選擇性標籤。主動學習是「主動選擇」要標籤的樣本,可以與半監督學習結合。

  • 主動學習 vs. 強化學習:強化學習通過與環境互動獲得獎勵訊號。主動學習的查詢策略類似強化學習的探索策略,都尋求最高訊息價值的動作。區別在於主動學習用於有監督的標籤任務,強化學習用於無直接標籤的決策任務。

  • 主動學習 vs. 遷移學習:遷移學習利用預訓練的知識減少標籤需求,主動學習基於不確定性選擇性標籤。兩者都解決標籤稀缺問題,但方向不同。實踐中常結合使用。

常見問題

主動學習需要多少初始標籤資料才能開始?

通常需要 50-200 個初始標籤樣本,取決於問題複雜度和類別數量。對於簡單的二分類問題,50 個樣本可能足夠;對於複雜的多類分類(如 50 類),需要數百個樣本。初始資料應包含各類別的代表樣本,避免初始模型過於偏斜。實務中,初始資料常通過隨機抽樣或分層抽樣獲得。初始模型的好壞直接影響後續查詢策略的效果,因此初始資料的質量很重要。

主動學習與聚群演算法有什麼聯繫?

聚群演算法(如 K-means、DBSCAN)常被用於主動學習的多樣性策略。例如,可以先用聚群演算法將未標籤樣本分組,然後從每個聚群中選擇不確定性最高的樣本進行標籤。這樣既保證了訊息價值(高不確定性),又保證了多樣性覆蓋(來自不同聚群)。此外,聚群中心或邊界樣本的不確定性往往較高,也可作為查詢候選。兩者結合能顯著提升主動學習效率。

主動學習適用於深度學習模型嗎?

是的,主動學習完全適用於深度學習。對於深度學習模型,可以用模型最後一層的置信度作為不確定性度量,或用 Dropout 技巧(多次推斷,計算輸出方差)估計不確定性。對於圖像分類,可以用深度網絡的中間層特徵計算樣本多樣性。深度學習版本的主動學習在醫療影像診斷、自然語言處理等領域已有成功應用。唯一的挑戰是深度學習的訓練成本較高,每次更新需要重新訓練,可能影響實時性。