---
title: "主動學習（Active Learning）"
slug: active-learning
language: zh-TW
source: https://aiterms.tw/learning/what-is-active-learning
updated_at: 2026-06-22
tags: [機器學習, 資料處理, 最佳化, AI基礎]
ipas_term: false
type: deep-dive
---

# 主動學習 是什麼？

> 一種機器學習策略，由演算法主動選擇最具訊息價值的未標籤樣本進行標籤，以最小化標籤成本並最大化模型性能

## 核心概念

主動學習解決的是機器學習中的核心難題：標籤資料成本高昂。在許多實務應用中，收集原始資料容易（如網路爬蟲、感測器），但對資料進行人工標籤耗時耗力。醫學影像診斷需要放射科醫生標籤，文本分類需要領域專家標籤，品質檢測需要人工檢驗。主動學習的核心思想是：與其被動地標籤隨機樣本，不如讓演算法主動選出「最能幫助模型改進」的樣本進行標籤。

主動學習與被動學習的根本差異在於標籤策略。被動學習假設訓練資料是隨機分布的，直接進行標籤。主動學習則利用模型的不確定性或邊界資訊，優先標籤那些模型最困惑、最可能改進的樣本。

## 運作原理

主動學習的典型工作流程分為三個環節：

- **初始化階段**：從未標籤的資料池中隨機選擇少量樣本進行標籤，訓練初始模型。

- **查詢階段**：演算法基於某種評分函數，計算未標籤樣本的「訊息價值」，排序後選出最有價值的樣本。

- **標籤與更新階段**：人工對選中的樣本進行標籤，將其加入訓練集，重新訓練模型。重複以上過程直到達到性能目標或標籤預算耗盡。

## 主要查詢策略：
- **不確定性採樣（Uncertainty Sampling）**：選擇模型預測置信度最低的樣本。對於分類任務，可以選擇預測概率最接近 0.5 的樣本（模型最困惑的）；對於迴歸任務，可以選擇預測方差最高的樣本。這是最簡單和最常用的策略。

- **查詢由分歧（Query by Committee）**：訓練多個模型（委員會），選擇委員會成員預測分歧最大的樣本。這個策略基於這樣的假設：如果多個模型對某個樣本的預測高度不一致，這個樣本一定包含豐富的訊息。

- **預期誤差減少（Expected Error Reduction）**：選擇能最大化預期泛化性能提升的樣本。這要求對每個候選樣本進行假設標籤，計算如果標籤該樣本模型性能會提升多少。計算成本高，但效果最好。

- **多樣性採樣（Diversity Sampling）**：不僅考慮訊息價值，還考慮樣本多樣性。如果選出的樣本都聚集在特定特徵空間，則資訊冗餘；應該選擇既有訊息價值又能覆蓋不同特徵空間的樣本。

## 實際應用

- **醫療影像診斷**：放射科影像（X 光、CT、MRI）的標籤成本極高。醫院可以用主動學習先訓練初始診斷模型，然後系統自動標記「最難判斷」的影像由放射科醫生確認，逐步改進模型。這樣可以減少 50-70% 的標籤工作量。

- **自然語言處理**：文本分類、命名實體識別、情感分析等都需要大量標籤資料。應用主動學習可以優先標籤模型最困惑的句子，如邊界情況和新穎表達方式。

- **垃圾郵件檢測**：新型垃圾郵件不斷出現，需要持續更新模型。主動學習可以優先標籤模型預測不確定、可能是新型垃圾郵件的郵件。

- **品質控制**：製造業中的產品缺陷檢測可以用主動學習減少人工檢驗工作。系統學習初期，對於邊界產品（接近合格/不合格判斷線）優先進行人工檢驗。

- **推薦系統的冷啟動**：新用戶或新商品時，主動學習可以優先向用戶查詢最具區分度的商品偏好（如問「你喜歡 A 類商品還是 B 類」），快速建立用戶檔案。

## 常見誤區

- **誤區 1：主動學習總是比被動學習好**。主動學習的優勢體現在「標籤成本」優化上，但並非在所有場景都成立。如果標籤成本忽略不計，或資料分布非常均衡，被動隨機標籤可能足夠。

- **誤區 2：主動學習無需初始訓練資料**。實際上主動學習需要初始的標籤資料來訓練初始模型，生成置信度估計。沒有初始模型，無法判斷哪些樣本最有價值。

- **誤區 3：主動學習一定會進入局部最優陷阱**。雖然初期集中標籤不確定樣本有風險，但結合多樣性採樣或查詢由分歧策略，可以平衡局部深度和全局廣度。

- **誤區 4：人工標籤一定正確**。在實務中，人工標籤也會出錯（如醫療診斷的誤診）。主動學習系統需要容納「標籤雜訊」。

## 與相關技術的比較

- **主動學習 vs. 被動學習**：被動學習隨機標籤，主動學習基於訊息價值選擇性標籤。主動學習在標籤預算有限的場景效率更高，但計算複雜度更高。

- **主動學習 vs. 半監督學習**：半監督學習利用未標籤資料的分布資訊來改進模型，但不涉及選擇性標籤。主動學習是「主動選擇」要標籤的樣本，可以與半監督學習結合。

- **主動學習 vs. 強化學習**：強化學習通過與環境互動獲得獎勵訊號。主動學習的查詢策略類似強化學習的探索策略，都尋求最高訊息價值的動作。區別在於主動學習用於有監督的標籤任務，強化學習用於無直接標籤的決策任務。

- **主動學習 vs. 遷移學習**：遷移學習利用預訓練的知識減少標籤需求，主動學習基於不確定性選擇性標籤。兩者都解決標籤稀缺問題，但方向不同。實踐中常結合使用。

## 常見問題

### 主動學習需要多少初始標籤資料才能開始？

通常需要 50-200 個初始標籤樣本，取決於問題複雜度和類別數量。對於簡單的二分類問題，50 個樣本可能足夠；對於複雜的多類分類（如 50 類），需要數百個樣本。初始資料應包含各類別的代表樣本，避免初始模型過於偏斜。實務中，初始資料常通過隨機抽樣或分層抽樣獲得。初始模型的好壞直接影響後續查詢策略的效果，因此初始資料的質量很重要。

### 主動學習與聚群演算法有什麼聯繫？

聚群演算法（如 K-means、DBSCAN）常被用於主動學習的多樣性策略。例如，可以先用聚群演算法將未標籤樣本分組，然後從每個聚群中選擇不確定性最高的樣本進行標籤。這樣既保證了訊息價值（高不確定性），又保證了多樣性覆蓋（來自不同聚群）。此外，聚群中心或邊界樣本的不確定性往往較高，也可作為查詢候選。兩者結合能顯著提升主動學習效率。

### 主動學習適用於深度學習模型嗎？

是的，主動學習完全適用於深度學習。對於深度學習模型，可以用模型最後一層的置信度作為不確定性度量，或用 Dropout 技巧（多次推斷，計算輸出方差）估計不確定性。對於圖像分類，可以用深度網絡的中間層特徵計算樣本多樣性。深度學習版本的主動學習在醫療影像診斷、自然語言處理等領域已有成功應用。唯一的挑戰是深度學習的訓練成本較高，每次更新需要重新訓練，可能影響實時性。

---

深度解說頁：https://aiterms.tw/learning/what-is-active-learning
快查頁：https://aiterms.tw/terms/active-learning
最後更新：2026/06/22