模型無關後設學習 是什麼?

Model Agnostic Meta-Learning:模型無關後設學習 的完整解釋

一種元學習方法,訓練模型使其對新任務能透過少量樣本迅速適應,與模型架構無關。

核心概念

MAML 解決的問題是傳統機器學習的資料飢渴症。訓練一個從頭到尾的分類器通常需要數千筆標籤樣本,但人類學習新概念往往只需看幾個例子。MAML 的目標是讓機器也能做到這一點。

MAML 的核心思想是後設優化。傳統訓練優化模型參數以最小化損失函數;MAML 進一步優化「優化過程本身」,使得模型經過少量梯度步驟後就能快速適應新任務。換句話說,MAML 尋找最佳的「初始參數」,從這個初始點出發,只需 1-5 步梯度下降就能解決新任務。

運作原理

MAML 訓練分為兩個層次的優化迴圈,稱為「內迴圈」和「外迴圈」:

  • 外迴圈(元訓練):對每個訓練任務,執行內迴圈完整流程
  • 內迴圈(任務適應):
    1. 用任務的支持集(少量標籤樣本)進行梯度步驟,生成任務特定參數
    2. 在任務的查詢集(驗證集)上評估適應後的模型
    3. 計算查詢集的損失
    4. 反向傳播梯度回到原始參數,更新外迴圈的參數

整個過程形成雙層優化:內迴圈適應單個任務,外迴圈優化初始參數使其對未見過的新任務也能快速適應。

演算法虛擬碼:

for each meta-training iteration:
  for each task in task_batch:
    1. 用支持集計算梯度,生成新參數:θ' = θ - α * ∇L_support(θ)
    2. 用查詢集計算損失:L_query(θ')
  3. 聚合所有任務的查詢損失
  4. 更新元參數:θ = θ - β * ∇(sum of query losses)

實際應用

在少樣本影像分類中,MAML 訓練後的模型可以用只有 5 張樣本的新物體類別進行分類。例如,訓練資料包含 64 個常見物體類別,每類 100 張圖片。測試時,引入完全新的 10 個物體類別,每類只提供 5 張樣本。傳統模型會完全失效,而 MAML 模型在這 5 張圖片上進行 1 步梯度更新後,就能在新類別上達到 70% 以上的準確率。

在機器人控制中,MAML 應用於讓機器人快速適應新環境。機器人在訓練環境中學習各種運動技能,每種技能都面臨略微不同的物理條件(如不同重量、摩擦力)。MAML 訓練的控制策略在遇到新環境時,只需透過幾次試錯就能調整,大幅加速機器人的適應過程。

在自然語言處理中,MAML 用於少樣本文本分類或命名實體識別。模型在多個來源領域(如新聞、社交媒體、醫學文獻)訓練,當面對全新領域時,只需用該領域的 10-20 個標籤樣本進行微調,就能達到可用的性能。

在藥物發現中,MAML 訓練的神經網絡可以用少量實驗數據快速預測新化合物的性質。相比從頭訓練需要數千個實驗數據點,MAML 模型用 100-200 個實驗就能達到可靠的預測能力。

常見誤區

誤區一:MAML 是「通用的」元學習解決方案。實際上,MAML 的效果高度依賴任務分布。若元訓練的任務與測試任務差異很大,MAML 的優勢消失。例如,若訓練任務都是分類,測試任務涉及迴歸或排序,MAML 無法遷移。MAML 最適用於任務多樣但結構相似的領域。

誤區二:MAML 自動解決少樣本學習。實際上,MAML 只是改進少樣本適應的效率,在極少樣本(如只有 1-2 個樣本)的情況下,即使 MAML 也難以達到高精度。MAML 的有效性通常從 5-10 個樣本開始顯現。

誤區三:MAML 的計算成本與傳統訓練相同。實際上,雙層優化迴圈導致 MAML 的訓練時間為傳統訓練的 10-20 倍。這限制了 MAML 的應用規模,大模型上的 MAML 訓練困難。

與相關技術的比較

  • MAML vs. 遷移學習:遷移學習訓練一個通用模型,新任務時進行微調;MAML 訓練初始參數,新任務時進行少量梯度步驟。MAML 對少樣本適應更高效,遷移學習實現更簡單。
  • MAML vs. 多任務學習:多任務學習同時訓練多個任務共享的表達;MAML 優化初始參數以快速適應新任務。多任務學習關注多任務協同,MAML 關注少樣本快速適應。
  • MAML vs. 原型網絡(Prototypical Networks):原型網絡學習類別的原型表達,用距離進行分類;MAML 學習梯度最陡峭的初始參數。原型網絡不改變模型,MAML 透過微小梯度步驟改變模型。MAML 通常性能更優。
  • MAML vs. 強化學習元學習:MAML 也用於強化學習,但在監督學習場景通常性能更優;強化學習專用的元學習方法會考慮探索與利用的權衡。

常見問題