自監督學習 是什麼?
Self-supervised Learning:自監督學習 的完整解釋
從未標注資料中自動建立監督信號以訓練模型的學習範式,無需人工標注。
自監督學習(Self-supervised Learning)近年來成為人工智慧研究中最重要的學習範式之一,尤其是在大型語言模型(LLM)與電腦視覺基礎模型的成功背後,自監督學習扮演了關鍵角色。
核心思想
傳統監督學習依賴大量人工標注的資料(如每張影像都要標記類別),但標注工作昂貴且耗時。無監督學習雖不需標注,但訓練目標模糊,學到的表示往往泛化能力不足。自監督學習的創新在於:從未標注的原始資料中,自動設計一個「藉口任務」(Pretext Task):利用資料自身的部分資訊來預測資料的另一部分,從而產生訓練信號。這個過程無需人工介入,卻能引導模型學習到豐富的語意表示。
代表性方法
自監督學習在不同模態中發展出各具特色的設計:
自然語言處理領域
- 遮罩語言建模(Masked Language Modeling, MLM):BERT 的核心預訓練任務,隨機遮住輸入句子中 15% 的詞,要求模型預測被遮住的詞。
- 自回歸語言建模(Autoregressive LM):GPT 系列的訓練方式,要求模型依序預測下一個詞,利用文字的自然順序作為監督信號。
- 句子順序預測(Sentence Order Prediction):判斷兩段文字的前後順序是否正確。
電腦視覺領域
- 對比學習(Contrastive Learning):SimCLR、MoCo 等方法,對同一張影像做兩種不同的隨機增強,讓模型學習「同一張圖的不同視角應映射到相近的表示空間,不同圖應映射到遠端」。
- 遮罩影像建模(Masked Image Modeling):MAE(Masked Autoencoders)隨機遮住影像的大部分像素(通常 75%),要求模型重建被遮住的部分。
- 圖像旋轉預測:預測影像被旋轉了幾度(0°/90°/180°/270°)。
多模態領域
- CLIP(Contrastive Language-Image Pretraining):利用大量(圖像、文字說明)配對資料,訓練圖像編碼器與文字編碼器使對應配對的表示相似、非配對的表示相異。
預訓練與微調的兩階段範式
自監督學習通常分為兩個階段:
- 預訓練(Pretraining):在大規模未標注資料上進行自監督訓練,讓模型學習通用的表示能力。
- 微調(Fine-tuning):在少量標注資料上針對特定下游任務進行監督訓練,利用預訓練學到的表示加速收斂並提升性能。
這種範式的核心價值在於:網際網路上存在海量的未標注文字、圖像、影片資料,自監督學習使我們能夠充分利用這些資源,而無需付出高昂的人工標注成本。
與相關概念的區別
- 自監督學習 vs. 半監督學習:半監督學習同時使用少量有標注資料與大量無標注資料;自監督學習在預訓練階段完全不使用人工標注。
- 自監督學習 vs. 無監督學習:無監督學習的目標通常是聚類或密度估計,沒有明確的預測任務;自監督學習有明確的預測目標(只是標籤由資料自動生成)。
- 自監督學習 vs. 遷移學習:自監督學習是一種預訓練方式,遷移學習是一個更廣義的概念,指將在一個任務上學到的知識遷移到另一個任務,自監督預訓練是實現遷移學習的重要手段之一。
重要性與影響
現代最成功的 AI 系統,無論是 GPT-4、Claude 等大型語言模型,還是 CLIP、DINO 等視覺基礎模型,其核心能力都源自大規模自監督預訓練。Yann LeCun 曾形象地將自監督學習比喻為「智慧的黑暗物質」,認為它是通往通用人工智慧的重要路徑。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 自監督學習 | 台灣正式用語 |
| 自监督学习 | 簡體寫法 |
| Self-Supervised Learning | 英文原名 |
| SSL | 縮寫,注意這個縮寫在資安領域另指加密協定 |
| 自我監督學習 | 常見變體 |
跟監督式、非監督式的關係
| 監督式 | 自監督式 | 非監督式 | |
|---|---|---|---|
| 標籤從哪來 | 人工標註 | 從資料本身自動構造 | 沒有標籤 |
| 訓練形式 | 預測標籤 | 預測標籤(只是標籤是造出來的) | 找結構 |
| 典型產出 | 任務模型 | 通用表示,之後再微調 | 分群、降維結果 |
自監督式常被歸在非監督式底下,因為兩者都不需要人工標註。但它的訓練形式其實是監督式的:有明確的預測目標與損失函數,只是那個目標是從資料裡挖出來的。這也是它效果好的原因,它同時拿到了「不用標註」與「有明確訓練訊號」兩個好處。
常見的前置任務
文字:遮住句中部分詞讓模型猜回來(BERT 的做法)、預測下一個詞(GPT 系列的做法)。現在的大型語言模型預訓練全部屬於這一類。
影像的對比式方法:同一張圖做兩種不同的隨機變換,要求模型把兩者的表示拉近,同時把不同圖的表示推遠。代表方法有 SimCLR、MoCo。關鍵在於資料增強要夠強,增強太弱模型可以靠顏色或紋理走捷徑,學不到語意。
影像的生成式方法:遮住影像的一部分讓模型還原,代表是 MAE(Masked Autoencoder),遮住的比例常常高達 75%。
多模態:用圖文配對訓練,讓對應的圖與文在同一個空間裡靠近,CLIP 是代表。這類方法的訓練訊號來自資料的天然配對關係,同樣不需要人工標註。
為什麼它是現在的主流
資料規模的門檻不一樣。 人工標註的資料以百萬計就很了不起,未標註的資料以十億計。基礎模型能力的躍升,主要來自能吃下後者。
學到的表示比較通用。 監督式訓練學到的是「怎麼分辨這幾個類別」,容易只抓到區分那幾類需要的特徵。自監督式的目標更難也更全面,學到的表示換到別的任務上仍然好用。
標準流程是自監督預訓練加上少量標註微調:預訓練吃掉大部分算力並學會通用表示,微調只需要幾百到幾千筆標註就能達到不錯的表現。這也是它在醫療影像、工業檢測這類標註昂貴的領域特別有價值的原因。