少樣本域轉移 是什麼?

Few-shot Domain Adaptation:少樣本域轉移 的完整解釋

用極少量目標域標籤資料,在保持源域知識的前提下快速適應新域。

核心概念

少樣本域轉移(Few-shot Domain Adaptation)是務實的學習策略,應對資源與效能的權衡。獲取大量標籤資料代價高,但完全無監督域轉移效果有限。少樣本域轉移的假設是目標域有 K 個標籤樣本(通常 K < 100),利用這少量信號加速適應。

核心洞察是:即使只有少量標籤,也能提供強大的適應信號。K 個標籤的資訊熵遠大於零,足以糾正無監督域轉移的誤差累積。在實務中,這往往是現實的假設:標籤新城市的 10 個地點總比標籤 1000 個地點可行。

運作原理

兩階段域轉移

第一階段:無監督預適應

  • 用無標籤目標域資料進行無監督域轉移
  • 用對抗學習、MMD 或其他域對齐方法減少域間差異
  • 目標是初步匹配分佈,建立轉移基礎

第二階段:監督微調

  • 混合少量標籤目標域資料和無標籤資料
  • 有監督損失糾正無監督轉移可能的誤方向
  • 快速收斂到目標域最優解

核心技術

主動學習策略

  • 不是隨機選擇要標籤的樣本,而是選擇「最有信息量」的樣本
  • 如選擇模型最不確定的樣本,標籤後收益最大
  • 減少所需標籤樣本數

元學習方法

  • 從源域多個任務中學習「快速適應能力」
  • 當新域少量標籤資料來臨時,能快速更新
  • 如 MAML(Model-Agnostic Meta-Learning):找到易於快速微調的初始參數

多任務學習

  • 同時利用源域多個相關任務和目標域資料
  • 建立跨任務的共享表示
  • 少量目標域標籤就能有效指導這些共享表示

自訓練與協同訓練

  • 自訓練:用模型在目標域的高信心預測作為偽標籤
  • 協同訓練:多個模型互相投票產生偽標籤,增加可靠性
  • 與標籤資料混合訓練,逐步改進

樣本複雜度

少樣本域轉移的效率用樣本複雜度衡量。理論上,只需 O(d) 個樣本就能識別 d 維空間的超平面。實務中通常需要 O(d/ε²) 個樣本達到精度 ε。對於高維問題(d 可達百萬),O(d) 仍很大。但利用預訓練(源域知識),實際所需樣本數遠小於理論下界。

實際應用

自駕車多城市適應

美國城市的自駕車模型用於歐洲時,需適應左駕、不同交通號誌、不同道路標記。收集歐洲每個城市 5000 張標籤影像的成本太高,但 50 張可接受。少樣本域轉移能用這 50 張快速適應,同時保持美國訓練的通用駕駛知識。

醫療影像轉移

模型在大型醫院(豐富資料)訓練。部署到小型診所時,只能獲得 20-30 個標籤病例。少樣本域轉移利用這少量病例適應新設備的成像風格,避免從零訓練導致的資源浪費。

語言模型領域適應

預訓練語言模型在通用文本上訓練。部署到法律領域時,只有 100 個標籤法律文件。少樣本域轉移快速適應法律詞彙和表達,成本遠低於重訓整個模型。

推薦系統新市場

推薦模型在成熟市場(如美國)訓練得很好。進入新市場(如印度)時,商品、用戶行為、文化背景都不同。收集全套標籤代價太高,但新市場 500 個用戶的交互資料易於獲取。少樣本域轉移能快速適應新市場偏好。

常見誤區

  • 認為少樣本 = 無需轉移:少樣本若直接微調會過擬合。域轉移策略是關鍵
  • 忽視樣本選擇的重要性:隨機選擇 K 個樣本不如聰明選擇 K/2 個樣本
  • 假設所有樣本等值:實務中,邊界樣本(接近決策邊界的點)價值遠高於核心樣本
  • 混淆少樣本學習與少樣本域轉移:前者是元學習框架;後者強調域異質性

與相關技術的比較

  • 少樣本域轉移 vs 無監督域轉移:前者有少量標籤,後者無標籤
  • 少樣本域轉移 vs 遷移學習微調:微調往往導致過擬合;轉移保護源域知識
  • 少樣本域轉移 vs 少樣本學習:後者處理完全新類別;前者在任務不變前提下轉移
  • 少樣本域轉移 vs 主動學習:主動學習選擇要標籤的樣本;轉移關注於分佈適應

常見問題