遷移學習 是什麼?
Transfer Learning:遷移學習 的完整解釋
遷移學習是將已在大數據集習得的知識,轉移應用至小數據集的新任務,藉此加速模型訓練
容易混淆
遷移學習 vs 微調 遷移學習是整體策略 微調是常見做法之一 最關鍵的區別:大方向和具體手段
遷移學習 vs 多任務學習 遷移學習是先學 A 再用到 B 多任務學習是 A 和 B 一起學 最關鍵的區別:順序和並行
遷移學習 vs 從零訓練 遷移學習先借現成能力 從零訓練完全自己學 最關鍵的區別:有沒有預先學過
記住這句就好
先借現成能力,再把新任務調到位。
實際案例
醫療影像 用大規模通用影像預訓練模型,再拿少量 X 光資料調整,通常比從零開始更快收斂
客服分類 先用通用語言模型,再用公司自己的客服對話微調,能更快學會公司內部用語
算法與應用
| 預訓練模型 | 先在大資料上學通用特徵 | 這是起點 | | 微調 | 用新任務資料再訓練 | 把通用能力轉成專用能力 | | 凍結層 | 保留部分參數不動 | 資料少時很常見 | | 負遷移 | 舊知識反而干擾新任務 | 領域差太遠時要小心 |
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 遷移學習 | 台灣正式用語 |
| 迁移学习 | 簡體寫法 |
| Transfer Learning | 英文原名 |
| 轉移學習 | 常見變體 |
跟微調、領域自適應的關係
遷移學習是最上位的概念:把在一個任務上學到的知識用到另一個任務。
微調(fine-tuning) 是遷移學習最常見的實作手段:拿預訓練模型,用目標任務的資料繼續訓練。
特徵萃取(feature extraction) 是另一種手段:凍結預訓練模型當成特徵抽取器,只訓練最後的分類頭。
領域自適應(domain adaptation) 是特例:任務相同但資料分布不同(同樣是辨識瑕疵,但換了一條產線的相機)。
該凍結多少層
| 情況 | 建議 |
|---|---|
| 目標資料少,且跟原任務相似 | 凍住大部分,只訓練最後幾層 |
| 目標資料少,但跟原任務差很多 | 凍住淺層(通用特徵),重訓中後段 |
| 目標資料多,且跟原任務相似 | 全部微調,用小學習率 |
| 目標資料多,但跟原任務差很多 | 可以全部微調,甚至考慮從頭訓練 |
判斷邏輯是:淺層學的是通用的邊緣與紋理,換任務也適用;深層學的是任務專屬的概念,換任務就要重學。 資料越少越要凍得多,因為可訓練參數越多越容易過度擬合。
微調時學習率要比原本訓練時小一個數量級以上,否則預訓練學到的東西會在前幾個批次就被破壞掉。常見做法是分層設定學習率,越接近輸出的層學習率越大。
什麼時候不該用
負遷移(negative transfer) 是指遷移之後表現比從頭訓練還差。它在來源任務與目標任務差異太大時會發生,例如拿自然影像預訓練的模型去做頻譜圖或醫學斷層掃描,有時反而不如從頭訓練。
判斷方式很直接:同時跑一次從頭訓練當對照組。多數人省略這一步,於是永遠不知道遷移到底有沒有幫助。
另一個要注意的是輸入前處理必須跟預訓練時一致。影像的正規化平均值與標準差、輸入尺寸、色彩通道順序,任何一項對不上,預訓練權重的價值就大打折扣。這是實務上最常見卻最容易被忽略的錯誤。
情境判斷
Q1(直覺題):你手上只有幾百張標註圖片,還適合從零訓練嗎? → 通常不適合,遷移學習會更實際。
Q2(判斷題):原任務和新任務差很遠,遷移學習一定有幫助嗎? → 不一定,差距太大時可能出現負遷移,這時要更仔細挑模型。
遷移學習 在 iPAS 考試中的重點
根據歷年統計,遷移學習 相關題目 平均佔 AI 技術類考題 2%, 屬於未分類考範圍。
常見出題方向:遷移學習的演算法原理與效益(40%)、預訓練模型與微調策略的技術細節(35%)、遷移學習的應用場景與實務(25%)。
相關術語
常見問題
遷移學習一定要微調全部參數嗎?
不一定,有時只改最後幾層就夠。
它只適合影像嗎?
不只,文字、語音、推薦系統都很常用。
資料很少時一定要用嗎?
多數情況值得先試,但還是要看原始任務和目標任務是否接近。
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定