模型無關後設學習 是什麼?
Model Agnostic Meta-Learning:模型無關後設學習 的完整解釋
一種元學習方法,訓練模型使其對新任務能透過少量樣本迅速適應,與模型架構無關。
核心概念
MAML 解決的問題是傳統機器學習的資料飢渴症。訓練一個從頭到尾的分類器通常需要數千筆標籤樣本,但人類學習新概念往往只需看幾個例子。MAML 的目標是讓機器也能做到這一點。
MAML 的核心思想是後設優化。傳統訓練優化模型參數以最小化損失函數;MAML 進一步優化「優化過程本身」,使得模型經過少量梯度步驟後就能快速適應新任務。換句話說,MAML 尋找最佳的「初始參數」,從這個初始點出發,只需 1-5 步梯度下降就能解決新任務。
運作原理
MAML 訓練分為兩個層次的優化迴圈,稱為「內迴圈」和「外迴圈」:
- 外迴圈(元訓練):對每個訓練任務,執行內迴圈完整流程
- 內迴圈(任務適應):
- 用任務的支持集(少量標籤樣本)進行梯度步驟,生成任務特定參數
- 在任務的查詢集(驗證集)上評估適應後的模型
- 計算查詢集的損失
- 反向傳播梯度回到原始參數,更新外迴圈的參數
整個過程形成雙層優化:內迴圈適應單個任務,外迴圈優化初始參數使其對未見過的新任務也能快速適應。
演算法虛擬碼:
for each meta-training iteration:
for each task in task_batch:
1. 用支持集計算梯度,生成新參數:θ' = θ - α * ∇L_support(θ)
2. 用查詢集計算損失:L_query(θ')
3. 聚合所有任務的查詢損失
4. 更新元參數:θ = θ - β * ∇(sum of query losses)
實際應用
在少樣本影像分類中,MAML 訓練後的模型可以用只有 5 張樣本的新物體類別進行分類。例如,訓練資料包含 64 個常見物體類別,每類 100 張圖片。測試時,引入完全新的 10 個物體類別,每類只提供 5 張樣本。傳統模型會完全失效,而 MAML 模型在這 5 張圖片上進行 1 步梯度更新後,就能在新類別上達到 70% 以上的準確率。
在機器人控制中,MAML 應用於讓機器人快速適應新環境。機器人在訓練環境中學習各種運動技能,每種技能都面臨略微不同的物理條件(如不同重量、摩擦力)。MAML 訓練的控制策略在遇到新環境時,只需透過幾次試錯就能調整,大幅加速機器人的適應過程。
在自然語言處理中,MAML 用於少樣本文本分類或命名實體識別。模型在多個來源領域(如新聞、社交媒體、醫學文獻)訓練,當面對全新領域時,只需用該領域的 10-20 個標籤樣本進行微調,就能達到可用的性能。
在藥物發現中,MAML 訓練的神經網絡可以用少量實驗數據快速預測新化合物的性質。相比從頭訓練需要數千個實驗數據點,MAML 模型用 100-200 個實驗就能達到可靠的預測能力。
常見誤區
誤區一:MAML 是「通用的」元學習解決方案。實際上,MAML 的效果高度依賴任務分布。若元訓練的任務與測試任務差異很大,MAML 的優勢消失。例如,若訓練任務都是分類,測試任務涉及迴歸或排序,MAML 無法遷移。MAML 最適用於任務多樣但結構相似的領域。
誤區二:MAML 自動解決少樣本學習。實際上,MAML 只是改進少樣本適應的效率,在極少樣本(如只有 1-2 個樣本)的情況下,即使 MAML 也難以達到高精度。MAML 的有效性通常從 5-10 個樣本開始顯現。
誤區三:MAML 的計算成本與傳統訓練相同。實際上,雙層優化迴圈導致 MAML 的訓練時間為傳統訓練的 10-20 倍。這限制了 MAML 的應用規模,大模型上的 MAML 訓練困難。
與相關技術的比較
- MAML vs. 遷移學習:遷移學習訓練一個通用模型,新任務時進行微調;MAML 訓練初始參數,新任務時進行少量梯度步驟。MAML 對少樣本適應更高效,遷移學習實現更簡單。
- MAML vs. 多任務學習:多任務學習同時訓練多個任務共享的表達;MAML 優化初始參數以快速適應新任務。多任務學習關注多任務協同,MAML 關注少樣本快速適應。
- MAML vs. 原型網絡(Prototypical Networks):原型網絡學習類別的原型表達,用距離進行分類;MAML 學習梯度最陡峭的初始參數。原型網絡不改變模型,MAML 透過微小梯度步驟改變模型。MAML 通常性能更優。
- MAML vs. 強化學習元學習:MAML 也用於強化學習,但在監督學習場景通常性能更優;強化學習專用的元學習方法會考慮探索與利用的權衡。