領域適應 是什麼?

Domain Adaptation:領域適應 的完整解釋

將在來源領域(Source Domain)訓練的模型調整為能有效應用於目標領域(Target Domain)的遷移學習技術。

領域適應(Domain Adaptation)是遷移學習的重要子領域,處理當訓練環境(來源領域)與實際部署環境(目標領域)存在分布差異時的模型適應問題。這在現實 AI 應用中極為普遍,因為收集大量目標領域的標注資料往往成本高昂或在技術上不可行。

領域適應的挑戰根源是「協變量偏移」(Covariate Shift)和「標籤偏移」(Label Shift)。協變量偏移指輸入特徵的分布在來源和目標領域之間不同(P_s(X) ≠ P_t(X)),但條件標籤分布 P(Y|X) 相同;標籤偏移指類別分布本身改變(如目標領域某疾病發病率更高)。不同類型的偏移需要不同的適應策略。

根據目標領域標注資料的可用性,領域適應分為幾種設定:無監督領域適應(Unsupervised Domain Adaptation, UDA)目標領域無任何標注,是研究最廣泛的設定;半監督領域適應目標領域有少量標注;監督領域適應(即一般的微調)目標領域有足夠標注,此時一般的微調即可。

無監督領域適應的主流技術包括幾類。特徵對齊方法(Feature Alignment)訓練特徵提取器使兩個領域的特徵分布趨於一致,DANN(Domain-Adversarial Neural Network)是代表性方法:在特徵提取器後加一個領域分類器,通過對抗訓練使特徵提取器生成「無法區分來源領域和目標領域的特徵」,從而實現隱式對齊。

自訓練(Self-Training)是另一類重要技術:先用在來源領域訓練的模型對目標領域無標注資料打偽標籤(Pseudo Labels),然後用高置信度的偽標籤作為監督信號繼續訓練,如此迭代。儘管偽標籤有一定誤差,這種自舉(Bootstrapping)方式通常能顯著提升目標領域性能。

在大型語言模型時代,領域適應通常以微調形式實現:在目標領域語料(如醫療文獻、法律條文、特定語言的文字)上繼續訓練(持續預訓練)或使用指令微調,讓 LLM 掌握目標領域的術語、風格和知識框架。參數高效微調(LoRA、Adapter)使這個過程以合理成本完成。

在 iPAS AI 應用規劃師考試中,領域適應是遷移學習章節的核心概念,考生需要理解與一般微調、零樣本學習的區別,以及在實際業務場景(如將通用 OCR 適應到特定行業票據識別)中的應用邏輯。

對抗領域適應(Adversarial Domain Adaptation)是無監督領域適應的重要方法系列。除前述的 DANN 外,ADDA(Adversarial Discriminative Domain Adaptation)通過判別式訓練策略提升對齊效果;MCD(Maximum Classifier Discrepancy)使用兩個任務分類器之間的不一致性作為領域差異的代理信號,引導特徵提取器最小化目標領域上兩個分類器的差異。

計算機視覺中的領域適應有獨特的應用場景:合成資料到真實資料的適應(Synthetic-to-Real Adaptation)。訓練自動駕駛感知系統時,可以用遊戲引擎(如 GTA5、CARLA)生成大量帶標注的合成圖像,再通過領域適應減少合成圖像與真實道路場景之間的外觀差距,大幅降低人工標注成本。

測試時適應(Test-Time Adaptation, TTA)是更進一步的設定:模型在測試時遇到分布偏移後,在不訪問源域資料的情況下,僅利用當前測試批次的統計資訊進行即時自我調整。TTT(Test-Time Training)等方法讓模型在測試推論時也能進行少量梯度更新,使其適應當前批次的分布特性,在自然影像分布偏移(如天氣變化、相機老化)的持續適應上展現潛力。

常見問題