少樣本域轉移 是什麼?
Few-shot Domain Adaptation:少樣本域轉移 的完整解釋
用極少量目標域標籤資料,在保持源域知識的前提下快速適應新域。
核心概念
少樣本域轉移(Few-shot Domain Adaptation)是務實的學習策略,應對資源與效能的權衡。獲取大量標籤資料代價高,但完全無監督域轉移效果有限。少樣本域轉移的假設是目標域有 K 個標籤樣本(通常 K < 100),利用這少量信號加速適應。
核心洞察是:即使只有少量標籤,也能提供強大的適應信號。K 個標籤的資訊熵遠大於零,足以糾正無監督域轉移的誤差累積。在實務中,這往往是現實的假設:標籤新城市的 10 個地點總比標籤 1000 個地點可行。
運作原理
兩階段域轉移
第一階段:無監督預適應
- 用無標籤目標域資料進行無監督域轉移
- 用對抗學習、MMD 或其他域對齐方法減少域間差異
- 目標是初步匹配分佈,建立轉移基礎
第二階段:監督微調
- 混合少量標籤目標域資料和無標籤資料
- 有監督損失糾正無監督轉移可能的誤方向
- 快速收斂到目標域最優解
核心技術
主動學習策略
- 不是隨機選擇要標籤的樣本,而是選擇「最有信息量」的樣本
- 如選擇模型最不確定的樣本,標籤後收益最大
- 減少所需標籤樣本數
元學習方法
- 從源域多個任務中學習「快速適應能力」
- 當新域少量標籤資料來臨時,能快速更新
- 如 MAML(Model-Agnostic Meta-Learning):找到易於快速微調的初始參數
多任務學習
- 同時利用源域多個相關任務和目標域資料
- 建立跨任務的共享表示
- 少量目標域標籤就能有效指導這些共享表示
自訓練與協同訓練
- 自訓練:用模型在目標域的高信心預測作為偽標籤
- 協同訓練:多個模型互相投票產生偽標籤,增加可靠性
- 與標籤資料混合訓練,逐步改進
樣本複雜度
少樣本域轉移的效率用樣本複雜度衡量。理論上,只需 O(d) 個樣本就能識別 d 維空間的超平面。實務中通常需要 O(d/ε²) 個樣本達到精度 ε。對於高維問題(d 可達百萬),O(d) 仍很大。但利用預訓練(源域知識),實際所需樣本數遠小於理論下界。
實際應用
自駕車多城市適應
美國城市的自駕車模型用於歐洲時,需適應左駕、不同交通號誌、不同道路標記。收集歐洲每個城市 5000 張標籤影像的成本太高,但 50 張可接受。少樣本域轉移能用這 50 張快速適應,同時保持美國訓練的通用駕駛知識。
醫療影像轉移
模型在大型醫院(豐富資料)訓練。部署到小型診所時,只能獲得 20-30 個標籤病例。少樣本域轉移利用這少量病例適應新設備的成像風格,避免從零訓練導致的資源浪費。
語言模型領域適應
預訓練語言模型在通用文本上訓練。部署到法律領域時,只有 100 個標籤法律文件。少樣本域轉移快速適應法律詞彙和表達,成本遠低於重訓整個模型。
推薦系統新市場
推薦模型在成熟市場(如美國)訓練得很好。進入新市場(如印度)時,商品、用戶行為、文化背景都不同。收集全套標籤代價太高,但新市場 500 個用戶的交互資料易於獲取。少樣本域轉移能快速適應新市場偏好。
常見誤區
- 認為少樣本 = 無需轉移:少樣本若直接微調會過擬合。域轉移策略是關鍵
- 忽視樣本選擇的重要性:隨機選擇 K 個樣本不如聰明選擇 K/2 個樣本
- 假設所有樣本等值:實務中,邊界樣本(接近決策邊界的點)價值遠高於核心樣本
- 混淆少樣本學習與少樣本域轉移:前者是元學習框架;後者強調域異質性
與相關技術的比較
- 少樣本域轉移 vs 無監督域轉移:前者有少量標籤,後者無標籤
- 少樣本域轉移 vs 遷移學習微調:微調往往導致過擬合;轉移保護源域知識
- 少樣本域轉移 vs 少樣本學習:後者處理完全新類別;前者在任務不變前提下轉移
- 少樣本域轉移 vs 主動學習:主動學習選擇要標籤的樣本;轉移關注於分佈適應