遷移學習 是什麼?

Transfer Learning:遷移學習 的完整解釋

遷移學習是將已在大數據集習得的知識,轉移應用至小數據集的新任務,藉此加速模型訓練

容易混淆

遷移學習 vs 微調 遷移學習是整體策略 微調是常見做法之一 最關鍵的區別:大方向和具體手段

遷移學習 vs 多任務學習 遷移學習是先學 A 再用到 B 多任務學習是 A 和 B 一起學 最關鍵的區別:順序和並行

遷移學習 vs 從零訓練 遷移學習先借現成能力 從零訓練完全自己學 最關鍵的區別:有沒有預先學過

記住這句就好

先借現成能力,再把新任務調到位。

實際案例

醫療影像 用大規模通用影像預訓練模型,再拿少量 X 光資料調整,通常比從零開始更快收斂

客服分類 先用通用語言模型,再用公司自己的客服對話微調,能更快學會公司內部用語

算法與應用

| 預訓練模型 | 先在大資料上學通用特徵 | 這是起點 | | 微調 | 用新任務資料再訓練 | 把通用能力轉成專用能力 | | 凍結層 | 保留部分參數不動 | 資料少時很常見 | | 負遷移 | 舊知識反而干擾新任務 | 領域差太遠時要小心 |

中英對照與常見說法

說法 出現場合
遷移學習 台灣正式用語
迁移学习 簡體寫法
Transfer Learning 英文原名
轉移學習 常見變體

跟微調、領域自適應的關係

遷移學習是最上位的概念:把在一個任務上學到的知識用到另一個任務。

微調(fine-tuning) 是遷移學習最常見的實作手段:拿預訓練模型,用目標任務的資料繼續訓練。

特徵萃取(feature extraction) 是另一種手段:凍結預訓練模型當成特徵抽取器,只訓練最後的分類頭。

領域自適應(domain adaptation) 是特例:任務相同但資料分布不同(同樣是辨識瑕疵,但換了一條產線的相機)。

該凍結多少層

情況 建議
目標資料少,且跟原任務相似 凍住大部分,只訓練最後幾層
目標資料少,但跟原任務差很多 凍住淺層(通用特徵),重訓中後段
目標資料多,且跟原任務相似 全部微調,用小學習率
目標資料多,但跟原任務差很多 可以全部微調,甚至考慮從頭訓練

判斷邏輯是:淺層學的是通用的邊緣與紋理,換任務也適用;深層學的是任務專屬的概念,換任務就要重學。 資料越少越要凍得多,因為可訓練參數越多越容易過度擬合。

微調時學習率要比原本訓練時小一個數量級以上,否則預訓練學到的東西會在前幾個批次就被破壞掉。常見做法是分層設定學習率,越接近輸出的層學習率越大。

什麼時候不該用

負遷移(negative transfer) 是指遷移之後表現比從頭訓練還差。它在來源任務與目標任務差異太大時會發生,例如拿自然影像預訓練的模型去做頻譜圖或醫學斷層掃描,有時反而不如從頭訓練。

判斷方式很直接:同時跑一次從頭訓練當對照組。多數人省略這一步,於是永遠不知道遷移到底有沒有幫助。

另一個要注意的是輸入前處理必須跟預訓練時一致。影像的正規化平均值與標準差、輸入尺寸、色彩通道順序,任何一項對不上,預訓練權重的價值就大打折扣。這是實務上最常見卻最容易被忽略的錯誤。

情境判斷

Q1(直覺題):你手上只有幾百張標註圖片,還適合從零訓練嗎? → 通常不適合,遷移學習會更實際。

Q2(判斷題):原任務和新任務差很遠,遷移學習一定有幫助嗎? → 不一定,差距太大時可能出現負遷移,這時要更仔細挑模型。

遷移學習 在 iPAS 考試中的重點

根據歷年統計,遷移學習 相關題目 平均佔 AI 技術類考題 2%, 屬於未分類考範圍。

常見出題方向:遷移學習的演算法原理與效益(40%)、預訓練模型與微調策略的技術細節(35%)、遷移學習的應用場景與實務(25%)。

相關術語

常見問題

遷移學習一定要微調全部參數嗎?

不一定,有時只改最後幾層就夠。

它只適合影像嗎?

不只,文字、語音、推薦系統都很常用。

資料很少時一定要用嗎?

多數情況值得先試,但還是要看原始任務和目標任務是否接近。

資料來源

← 回到 遷移學習 快查頁

測驗你對 遷移學習 的理解

透過模擬考系統檢驗學習成果

開始測驗