自監督學習 是什麼?

Self-supervised Learning:自監督學習 的完整解釋

從未標注資料中自動建立監督信號以訓練模型的學習範式,無需人工標注。

自監督學習(Self-supervised Learning)近年來成為人工智慧研究中最重要的學習範式之一,尤其是在大型語言模型(LLM)與電腦視覺基礎模型的成功背後,自監督學習扮演了關鍵角色。

核心思想

傳統監督學習依賴大量人工標注的資料(如每張影像都要標記類別),但標注工作昂貴且耗時。無監督學習雖不需標注,但訓練目標模糊,學到的表示往往泛化能力不足。自監督學習的創新在於:從未標注的原始資料中,自動設計一個「藉口任務」(Pretext Task):利用資料自身的部分資訊來預測資料的另一部分,從而產生訓練信號。這個過程無需人工介入,卻能引導模型學習到豐富的語意表示。

代表性方法

自監督學習在不同模態中發展出各具特色的設計:

自然語言處理領域

  • 遮罩語言建模(Masked Language Modeling, MLM):BERT 的核心預訓練任務,隨機遮住輸入句子中 15% 的詞,要求模型預測被遮住的詞。
  • 自回歸語言建模(Autoregressive LM):GPT 系列的訓練方式,要求模型依序預測下一個詞,利用文字的自然順序作為監督信號。
  • 句子順序預測(Sentence Order Prediction):判斷兩段文字的前後順序是否正確。

電腦視覺領域

  • 對比學習(Contrastive Learning):SimCLR、MoCo 等方法,對同一張影像做兩種不同的隨機增強,讓模型學習「同一張圖的不同視角應映射到相近的表示空間,不同圖應映射到遠端」。
  • 遮罩影像建模(Masked Image Modeling):MAE(Masked Autoencoders)隨機遮住影像的大部分像素(通常 75%),要求模型重建被遮住的部分。
  • 圖像旋轉預測:預測影像被旋轉了幾度(0°/90°/180°/270°)。

多模態領域

  • CLIP(Contrastive Language-Image Pretraining):利用大量(圖像、文字說明)配對資料,訓練圖像編碼器與文字編碼器使對應配對的表示相似、非配對的表示相異。

預訓練與微調的兩階段範式

自監督學習通常分為兩個階段:

  1. 預訓練(Pretraining):在大規模未標注資料上進行自監督訓練,讓模型學習通用的表示能力。
  2. 微調(Fine-tuning):在少量標注資料上針對特定下游任務進行監督訓練,利用預訓練學到的表示加速收斂並提升性能。

這種範式的核心價值在於:網際網路上存在海量的未標注文字、圖像、影片資料,自監督學習使我們能夠充分利用這些資源,而無需付出高昂的人工標注成本。

與相關概念的區別

  • 自監督學習 vs. 半監督學習:半監督學習同時使用少量有標注資料與大量無標注資料;自監督學習在預訓練階段完全不使用人工標注。
  • 自監督學習 vs. 無監督學習:無監督學習的目標通常是聚類或密度估計,沒有明確的預測任務;自監督學習有明確的預測目標(只是標籤由資料自動生成)。
  • 自監督學習 vs. 遷移學習:自監督學習是一種預訓練方式,遷移學習是一個更廣義的概念,指將在一個任務上學到的知識遷移到另一個任務,自監督預訓練是實現遷移學習的重要手段之一。

重要性與影響

現代最成功的 AI 系統,無論是 GPT-4、Claude 等大型語言模型,還是 CLIP、DINO 等視覺基礎模型,其核心能力都源自大規模自監督預訓練。Yann LeCun 曾形象地將自監督學習比喻為「智慧的黑暗物質」,認為它是通往通用人工智慧的重要路徑。

中英對照與常見說法

說法 出現場合
自監督學習 台灣正式用語
自监督学习 簡體寫法
Self-Supervised Learning 英文原名
SSL 縮寫,注意這個縮寫在資安領域另指加密協定
自我監督學習 常見變體

跟監督式、非監督式的關係

監督式 自監督式 非監督式
標籤從哪來 人工標註 從資料本身自動構造 沒有標籤
訓練形式 預測標籤 預測標籤(只是標籤是造出來的) 找結構
典型產出 任務模型 通用表示,之後再微調 分群、降維結果

自監督式常被歸在非監督式底下,因為兩者都不需要人工標註。但它的訓練形式其實是監督式的:有明確的預測目標與損失函數,只是那個目標是從資料裡挖出來的。這也是它效果好的原因,它同時拿到了「不用標註」與「有明確訓練訊號」兩個好處。

常見的前置任務

文字:遮住句中部分詞讓模型猜回來(BERT 的做法)、預測下一個詞(GPT 系列的做法)。現在的大型語言模型預訓練全部屬於這一類。

影像的對比式方法:同一張圖做兩種不同的隨機變換,要求模型把兩者的表示拉近,同時把不同圖的表示推遠。代表方法有 SimCLR、MoCo。關鍵在於資料增強要夠強,增強太弱模型可以靠顏色或紋理走捷徑,學不到語意。

影像的生成式方法:遮住影像的一部分讓模型還原,代表是 MAE(Masked Autoencoder),遮住的比例常常高達 75%。

多模態:用圖文配對訓練,讓對應的圖與文在同一個空間裡靠近,CLIP 是代表。這類方法的訓練訊號來自資料的天然配對關係,同樣不需要人工標註。

為什麼它是現在的主流

資料規模的門檻不一樣。 人工標註的資料以百萬計就很了不起,未標註的資料以十億計。基礎模型能力的躍升,主要來自能吃下後者。

學到的表示比較通用。 監督式訓練學到的是「怎麼分辨這幾個類別」,容易只抓到區分那幾類需要的特徵。自監督式的目標更難也更全面,學到的表示換到別的任務上仍然好用。

標準流程是自監督預訓練加上少量標註微調:預訓練吃掉大部分算力並學會通用表示,微調只需要幾百到幾千筆標註就能達到不錯的表現。這也是它在醫療影像、工業檢測這類標註昂貴的領域特別有價值的原因。

常見問題