模型無關後設學習(Model Agnostic Meta-Learning)是什麼?

一種元學習方法,訓練模型使其對新任務能透過少量樣本迅速適應,與模型架構無關。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Model Agnostic Meta-Learning
主題標籤
機器學習、AI基礎、AI應用
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
模型無關後設學習(Model Agnostic Meta-Learning)是什麼? 機器學習AI基礎
術語快查

搜尋意圖: 如果你在找「模型無關後設學習 是什麼」或「模型無關後設學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 一種元學習方法,訓練模型使其對新任務能透過少量樣本迅速適應,與模型架構無關。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

一種元學習方法,訓練模型使其對新任務能透過少量樣本迅速適應,與模型架構無關。

核心概念

MAML 解決的問題是傳統機器學習的資料飢渴症。訓練一個從頭到尾的分類器通常需要數千筆標籤樣本,但人類學習新概念往往只需看幾個例子。MAML 的目標是讓機器也能做到這一點。

MAML 的核心思想是後設優化。傳統訓練優化模型參數以最小化損失函數;MAML 進一步優化「優化過程本身」,使得模型經過少量梯度步驟後就能快速適應新任務。換句話說,MAML 尋找最佳的「初始參數」,從這個初始點出發,只需 1-5 步梯度下降就能解決新任務。

運作原理

MAML 訓練分為兩個層次的優化迴圈,稱為「內迴圈」和「外迴圈」:

  • 外迴圈(元訓練):對每個訓練任務,執行內迴圈完整流程
  • 內迴圈(任務適應):
    1. 用任務的支持集(少量標籤樣本)進行梯度步驟,生成任務特定參數
    2. 在任務的查詢集(驗證集)上評估適應後的模型
    3. 計算查詢集的損失
    4. 反向傳播梯度回到原始參數,更新外迴圈的參數

整個過程形成雙層優化:內迴圈適應單個任務,外迴圈優化初始參數使其對未見過的新任務也能快速適應。

演算法虛擬碼:

for each meta-training iteration:
  for each task in task_batch:
    1. 用支持集計算梯度,生成新參數:θ' = θ - α * ∇L_support(θ)
    2. 用查詢集計算損失:L_query(θ')
  3. 聚合所有任務的查詢損失
  4. 更新元參數:θ = θ - β * ∇(sum of query losses)

實際應用

在少樣本影像分類中,MAML 訓練後的模型可以用只有 5 張樣本的新物體類別進行分類。例如,訓練資料包含 64 個常見物體類別,每類 100 張圖片。測試時,引入完全新的 10 個物體類別,每類只提供 5 張樣本。傳統模型會完全失效,而 MAML 模型在這 5 張圖片上進行 1 步梯度更新後,就能在新類別上達到 70% 以上的準確率。

在機器人控制中,MAML 應用於讓機器人快速適應新環境。機器人在訓練環境中學習各種運動技能,每種技能都面臨略微不同的物理條件(如不同重量、摩擦力)。MAML 訓練的控制策略在遇到新環境時,只需透過幾次試錯就能調整,大幅加速機器人的適應過程。

在自然語言處理中,MAML 用於少樣本文本分類或命名實體識別。模型在多個來源領域(如新聞、社交媒體、醫學文獻)訓練,當面對全新領域時,只需用該領域的 10-20 個標籤樣本進行微調,就能達到可用的性能。

在藥物發現中,MAML 訓練的神經網絡可以用少量實驗數據快速預測新化合物的性質。相比從頭訓練需要數千個實驗數據點,MAML 模型用 100-200 個實驗就能達到可靠的預測能力。

常見誤區

誤區一:MAML 是「通用的」元學習解決方案。實際上,MAML 的效果高度依賴任務分布。若元訓練的任務與測試任務差異很大,MAML 的優勢消失。例如,若訓練任務都是分類,測試任務涉及迴歸或排序,MAML 無法遷移。MAML 最適用於任務多樣但結構相似的領域。

誤區二:MAML 自動解決少樣本學習。實際上,MAML 只是改進少樣本適應的效率,在極少樣本(如只有 1-2 個樣本)的情況下,即使 MAML 也難以達到高精度。MAML 的有效性通常從 5-10 個樣本開始顯現。

誤區三:MAML 的計算成本與傳統訓練相同。實際上,雙層優化迴圈導致 MAML 的訓練時間為傳統訓練的 10-20 倍。這限制了 MAML 的應用規模,大模型上的 MAML 訓練困難。

與相關技術的比較

  • MAML vs. 遷移學習:遷移學習訓練一個通用模型,新任務時進行微調;MAML 訓練初始參數,新任務時進行少量梯度步驟。MAML 對少樣本適應更高效,遷移學習實現更簡單。
  • MAML vs. 多任務學習:多任務學習同時訓練多個任務共享的表達;MAML 優化初始參數以快速適應新任務。多任務學習關注多任務協同,MAML 關注少樣本快速適應。
  • MAML vs. 原型網絡(Prototypical Networks):原型網絡學習類別的原型表達,用距離進行分類;MAML 學習梯度最陡峭的初始參數。原型網絡不改變模型,MAML 透過微小梯度步驟改變模型。MAML 通常性能更優。
  • MAML vs. 強化學習元學習:MAML 也用於強化學習,但在監督學習場景通常性能更優;強化學習專用的元學習方法會考慮探索與利用的權衡。

常見問題

MAML 的訓練成本為什麼這麼高?有什麼加速方法?

MAML 的計算成本來自雙層優化迴圈。每次外迴圈更新,都需對每個任務執行完整內迴圈(梯度計算、參數更新、前向傳播),遠高於傳統訓練的單層優化。加速方法包括:一、減少內迴圈的梯度步驟數(通常 1 步就足夠,不必 5 步);二、採用二階導數近似(如 first-order MAML)減少二階微分計算;三、批量化任務處理,利用 GPU 並行化;四、用更簡單的模型或更小的資料集進行元訓練(降低單次計算量)。實務中,first-order MAML(只計算一階導數)的成本約為標準 MAML 的 20-30%,性能損失不大,是實用的折中。

如何為 MAML 設計合適的任務分佈進行元訓練?

元訓練任務分布的設計決定了 MAML 對新任務的適應能力。首先,任務應有足夠的多樣性,涵蓋測試時可能遇到的情景變化。例如,若目標是少樣本影像分類,訓練任務應包含不同物體、背景、光照的圖片。其次,任務數量應充足,通常需要 100+ 個訓練任務。第三,訓練任務與測試任務的分布要有相似性,但也要有適度差異,這樣元訓練的初始參數才能泛化到測試任務。第四,支持集和查詢集的大小應與測試時的預期一致(例如測試時只有 5 個樣本,訓練時的支持集就應是 5-10 個樣本)。實驗中常用的做法是分層採樣:先定義高層任務類別,再在每類內生成多個具體任務實例。

什麼時候應該用 MAML,什麼時候用其他方法更合適?

選擇 MAML 需要滿足幾個條件。首先,必須有少樣本快速適應的需求(如果有充足標籤資料,標準監督學習更簡單)。其次,應有足夠的元訓練任務(100+ 個),如果任務稀缺,MAML 無法充分訓練。第三,任務類型相似(都是分類或都是迴歸),MAML 對差異大的任務混合效果差。如果用途是通用特徵學習而非快速新任務適應,遷移學習更合適。如果只有靜態訓練任務無法隨時生成新任務,可考慮原型網絡或匹配網絡。如果涉及強化學習,需要評估 MAML 在該領域的效果(某些場景下不如專用強化學習元學習方法)。總體而言,MAML 最適合「有豐富多樣的元訓練任務、需要在新任務上快速適應、計算成本可以承受」的場景。