少樣本域轉移(Few-shot Domain Adaptation)是什麼?

用極少量目標域標籤資料,在保持源域知識的前提下快速適應新域。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Few-shot Domain Adaptation
主題標籤
遷移學習、機器學習、深度學習
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
少樣本域轉移(Few-shot Domain Adaptation)是什麼? 遷移學習機器學習
術語快查

搜尋意圖: 如果你在找「少樣本域轉移 是什麼」或「少樣本域轉移 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 用極少量目標域標籤資料,在保持源域知識的前提下快速適應新域。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

用極少量目標域標籤資料,在保持源域知識的前提下快速適應新域。

核心概念

少樣本域轉移(Few-shot Domain Adaptation)是務實的學習策略,應對資源與效能的權衡。獲取大量標籤資料代價高,但完全無監督域轉移效果有限。少樣本域轉移的假設是目標域有 K 個標籤樣本(通常 K < 100),利用這少量信號加速適應。

核心洞察是:即使只有少量標籤,也能提供強大的適應信號。K 個標籤的資訊熵遠大於零,足以糾正無監督域轉移的誤差累積。在實務中,這往往是現實的假設:標籤新城市的 10 個地點總比標籤 1000 個地點可行。

運作原理

兩階段域轉移

第一階段:無監督預適應

  • 用無標籤目標域資料進行無監督域轉移
  • 用對抗學習、MMD 或其他域對齐方法減少域間差異
  • 目標是初步匹配分佈,建立轉移基礎

第二階段:監督微調

  • 混合少量標籤目標域資料和無標籤資料
  • 有監督損失糾正無監督轉移可能的誤方向
  • 快速收斂到目標域最優解

核心技術

主動學習策略

  • 不是隨機選擇要標籤的樣本,而是選擇「最有信息量」的樣本
  • 如選擇模型最不確定的樣本,標籤後收益最大
  • 減少所需標籤樣本數

元學習方法

  • 從源域多個任務中學習「快速適應能力」
  • 當新域少量標籤資料來臨時,能快速更新
  • 如 MAML(Model-Agnostic Meta-Learning):找到易於快速微調的初始參數

多任務學習

  • 同時利用源域多個相關任務和目標域資料
  • 建立跨任務的共享表示
  • 少量目標域標籤就能有效指導這些共享表示

自訓練與協同訓練

  • 自訓練:用模型在目標域的高信心預測作為偽標籤
  • 協同訓練:多個模型互相投票產生偽標籤,增加可靠性
  • 與標籤資料混合訓練,逐步改進

樣本複雜度

少樣本域轉移的效率用樣本複雜度衡量。理論上,只需 O(d) 個樣本就能識別 d 維空間的超平面。實務中通常需要 O(d/ε²) 個樣本達到精度 ε。對於高維問題(d 可達百萬),O(d) 仍很大。但利用預訓練(源域知識),實際所需樣本數遠小於理論下界。

實際應用

自駕車多城市適應

美國城市的自駕車模型用於歐洲時,需適應左駕、不同交通號誌、不同道路標記。收集歐洲每個城市 5000 張標籤影像的成本太高,但 50 張可接受。少樣本域轉移能用這 50 張快速適應,同時保持美國訓練的通用駕駛知識。

醫療影像轉移

模型在大型醫院(豐富資料)訓練。部署到小型診所時,只能獲得 20-30 個標籤病例。少樣本域轉移利用這少量病例適應新設備的成像風格,避免從零訓練導致的資源浪費。

語言模型領域適應

預訓練語言模型在通用文本上訓練。部署到法律領域時,只有 100 個標籤法律文件。少樣本域轉移快速適應法律詞彙和表達,成本遠低於重訓整個模型。

推薦系統新市場

推薦模型在成熟市場(如美國)訓練得很好。進入新市場(如印度)時,商品、用戶行為、文化背景都不同。收集全套標籤代價太高,但新市場 500 個用戶的交互資料易於獲取。少樣本域轉移能快速適應新市場偏好。

常見誤區

  • 認為少樣本 = 無需轉移:少樣本若直接微調會過擬合。域轉移策略是關鍵
  • 忽視樣本選擇的重要性:隨機選擇 K 個樣本不如聰明選擇 K/2 個樣本
  • 假設所有樣本等值:實務中,邊界樣本(接近決策邊界的點)價值遠高於核心樣本
  • 混淆少樣本學習與少樣本域轉移:前者是元學習框架;後者強調域異質性

與相關技術的比較

  • 少樣本域轉移 vs 無監督域轉移:前者有少量標籤,後者無標籤
  • 少樣本域轉移 vs 遷移學習微調:微調往往導致過擬合;轉移保護源域知識
  • 少樣本域轉移 vs 少樣本學習:後者處理完全新類別;前者在任務不變前提下轉移
  • 少樣本域轉移 vs 主動學習:主動學習選擇要標籤的樣本;轉移關注於分佈適應

常見問題

在少樣本域轉移中,如何決定無監督預適應和監督微調的比例?

這取決於目標域標籤資料的品質和源域與目標域的相似度。若源域和目標域高度相似(如同一設備不同場景),無監督預適應可以輕一點,標籤資料的作用快速糾正細節。若域間差異大(如合成資料到真實資料),需要更充分的無監督預適應建立基礎。實務策略是監控驗證集性能:若驗證準確率高,可減少無監督階段;若驗證準確率低,說明無監督適應不足,應增加無監督預訓練週期。典型比例是無監督預適應 10 個 epoch,監督微調 5 個 epoch,但應根據具體應用調整。

如何選擇目標域中應該標籤的樣本來最大化學習效率?

最簡單的方法是隨機選擇,但聰明選擇能顯著減少所需樣本數。主動學習方法選擇模型最不確定的樣本(最接近決策邊界的點),因為這些樣本提供的信息量最大。計算方法是用模型預測概率,選擇熵最高(類別概率最接近 50-50)的樣本。另一種方法是多樣性採樣,選擇在特徵空間中分散最遠的樣本,覆蓋目標域的各個區域。有些方法結合兩者:先用多樣性採樣得到樣本集合,再用不確定性排序,標籤最不確定的樣本。實驗表明,聰明選擇 50 個樣本的效果往往勝於隨機選擇 100 個樣本。

少樣本域轉移中的「偽標籤」為什麼有用但也有風險?

偽標籤的原理是在無標籤目標域資料上運用已訓練模型,用高信心預測作為標籤進行後續訓練。有用之處在於充分利用無標籤資料,提供額外的監督信號,加速適應。風險在於若初期適應不當,模型做出的偽標籤可能錯誤,這些錯誤標籤會強化模型偏見,導致誤差累積。解決方法是置信度過濾:只接受模型信心度超過閾值(如 0.9)的預測作為偽標籤。另外,可用多個模型協同投票產生偽標籤,降低個別模型偏見。也可用自訓練與監督訓練交替進行,每次交替前用真標籤驗證偽標籤品質,發現問題及時糾正。