委員會查詢 是什麼?

Query by Committee:委員會查詢 的完整解釋

在主動學習中訓練多個模型,選擇它們預測意見分歧最大的樣本進行標籤,以高效識別決策邊界。

核心概念

委員會查詢的核心洞察是模型分歧 = 高價值樣本。當多個独立訓練的模型對同一樣本給出不同預測時,往往代表該樣本涉及多個模型都難以確定的特徵組合。與其依賴單一模型的信心度(容易被模型偏見影響),不如用委員會投票的一致性作為判斷,更加穩健。

委員會通常由 5-15 個模型組成,可以是:

  • 同種模型、不同初始化:例如 10 個神經網絡,用同樣超參數但不同隨機種子訓練
  • 不同模型架構:決策樹、支向量機、神經網絡等混用,捕捉不同視角
  • 自助取樣:每次從訓練集有放回抽樣訓練一個模型(類似 bagging),但訓練時保持其他隨機性
  • 特徵子集:每個模型用不同的特徵組合訓練,降低過擬合同時增加多樣性

運作原理

委員會查詢的流程包括六個步驟:

  • 初始化:用少量標籤資料訓練委員會的所有成員
  • 預測與計票:對每筆未標籤樣本,委員會所有成員進行預測
  • 分歧量化:計算委員會意見的一致性,常用方法如投票熵、分類貢獻度、或變分率
  • 樣本排序:選擇分歧最高的前 K 筆樣本
  • 標籤與更新:將選中樣本標籤並加入訓練集,重新訓練委員會全體成員
  • 反覆迭代:返回步驟 2 直到預算用盡

分歧量化是關鍵技術。最簡單的是投票分歧:如果 N 個模型都預測同一類別,分歧度為 0;若 N/2 預測 A、N/2 預測 B,分歧度最大。更精確的方法是投票熵,考慮各類別的投票比例分佈。對於概率輸出,可以計算委員會預測分佈的標準差或方差,方差越大表示分歧越多。

實際應用

在疾病診斷中,醫院訓練了 10 個深度學習模型,每個用不同神經網絡架構或訓練資料子集。對新病患的 CT 掃描,這 10 個模型進行診斷投票。若 8 個判定為「正常」、2 個判定為「異常」,說明該案例的判斷具有挑戰性,應優先提交給放射科醫生詳細評估。醫生的判定既標籤了該樣本,也改進了整個模型委員會的決策邊界。

在網路詐欺檢測中,平台訓練多個詐欺分類器(隨機森林、梯度提升、神經網絡等),對未知交易進行風險評估。當多個模型在某筆交易上意見不一致時(例如有 3 個判定詐欺、4 個判定正常),該交易進入人工審查隊列。審查員的判定幫助模型委員會更好地理解邊界交易的特徵。

在文件分類系統中,銀行需要分類進來的貸款申請書。訓練的多個分類器(樸素貝葉斯、SVM、XGBoost)對某些複雜申請書產生分歧,系統自動將這些申請書分配給信貸專員人工審核,審核結果反饋給模型。

常見誤區

誤區一:委員會越大越好。實際上,委員會規模需要平衡。太小的委員會(3-4 成員)難以可靠估計分歧;太大的委員會(50+ 成員)計算成本過高且邊際效益遞減。實驗表明 10-15 成員通常是最優區間。

誤區二:認為不同初始化就能產生足夠多樣性。實際上,用同一種模型架構和特徵集、僅改變隨機種子訓練的委員會往往缺乏多樣性,容易產生相關的預測。更好的做法是混合不同架構或使用特徵子集取樣,增加委員會的多樣性。

誤區三:投票分歧可以直接替代單模型預測概率。實際上,投票分歧衡量的是模型間的不一致,而非模型的校準品質。一個委員會可能投票一致但都錯,也可能投票分歧但投票結果正確。應該同時監控投票準確率和分歧率的關係。

與相關技術的比較

  • 委員會查詢 vs. 不確定性抽樣:委員會用多模型投票估計不確定性,更穩健但計算成本高;不確定性抽樣只需單一模型,快速但容易受模型偏見影響。若計算資源充足,委員會通常效果更優。
  • 委員會查詢 vs. 集成學習:集成學習(bagging、boosting)用多模型提高預測準確率,委員會查詢用委員會的分歧指導選樣。兩者可以結合,用集成模型作為委員會。
  • 委員會查詢 vs. 期望梯度法:期望梯度直接計算標籤該樣本對參數梯度的期望改進,理論最優但計算複雜。委員會查詢更簡單直觀,實務中常見。
  • 委員會查詢 vs. 強化學習主動學習:強化學習可學習何時查詢,委員會查詢是固定查詢策略。強化學習更靈活但需要大量訓練;委員會查詢開箱即用。

常見問題