自監督學習(Self-supervised Learning)是什麼?

從未標注資料中自動建立監督信號以訓練模型的學習範式,無需人工標注。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Self-supervised Learning
主題標籤
預訓練、表示學習、大型語言模型
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
自監督學習(Self-supervised Learning)是什麼? 預訓練表示學習
術語快查

搜尋意圖: 如果你在找「自監督學習 是什麼」或「自監督學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從未標注資料中自動建立監督信號以訓練模型的學習範式,無需人工標注。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從未標注資料中自動建立監督信號以訓練模型的學習範式,無需人工標注。

自監督學習(Self-supervised Learning)近年來成為人工智慧研究中最重要的學習範式之一,尤其是在大型語言模型(LLM)與電腦視覺基礎模型的成功背後,自監督學習扮演了關鍵角色。

核心思想

傳統監督學習依賴大量人工標注的資料(如每張影像都要標記類別),但標注工作昂貴且耗時。無監督學習雖不需標注,但訓練目標模糊,學到的表示往往泛化能力不足。自監督學習的創新在於:從未標注的原始資料中,自動設計一個「藉口任務」(Pretext Task):利用資料自身的部分資訊來預測資料的另一部分,從而產生訓練信號。這個過程無需人工介入,卻能引導模型學習到豐富的語意表示。

代表性方法

自監督學習在不同模態中發展出各具特色的設計:

自然語言處理領域

  • 遮罩語言建模(Masked Language Modeling, MLM):BERT 的核心預訓練任務,隨機遮住輸入句子中 15% 的詞,要求模型預測被遮住的詞。
  • 自回歸語言建模(Autoregressive LM):GPT 系列的訓練方式,要求模型依序預測下一個詞,利用文字的自然順序作為監督信號。
  • 句子順序預測(Sentence Order Prediction):判斷兩段文字的前後順序是否正確。

電腦視覺領域

  • 對比學習(Contrastive Learning):SimCLR、MoCo 等方法,對同一張影像做兩種不同的隨機增強,讓模型學習「同一張圖的不同視角應映射到相近的表示空間,不同圖應映射到遠端」。
  • 遮罩影像建模(Masked Image Modeling):MAE(Masked Autoencoders)隨機遮住影像的大部分像素(通常 75%),要求模型重建被遮住的部分。
  • 圖像旋轉預測:預測影像被旋轉了幾度(0°/90°/180°/270°)。

多模態領域

  • CLIP(Contrastive Language-Image Pretraining):利用大量(圖像、文字說明)配對資料,訓練圖像編碼器與文字編碼器使對應配對的表示相似、非配對的表示相異。

預訓練與微調的兩階段範式

自監督學習通常分為兩個階段:

  1. 預訓練(Pretraining):在大規模未標注資料上進行自監督訓練,讓模型學習通用的表示能力。
  2. 微調(Fine-tuning):在少量標注資料上針對特定下游任務進行監督訓練,利用預訓練學到的表示加速收斂並提升性能。

這種範式的核心價值在於:網際網路上存在海量的未標注文字、圖像、影片資料,自監督學習使我們能夠充分利用這些資源,而無需付出高昂的人工標注成本。

與相關概念的區別

  • 自監督學習 vs. 半監督學習:半監督學習同時使用少量有標注資料與大量無標注資料;自監督學習在預訓練階段完全不使用人工標注。
  • 自監督學習 vs. 無監督學習:無監督學習的目標通常是聚類或密度估計,沒有明確的預測任務;自監督學習有明確的預測目標(只是標籤由資料自動生成)。
  • 自監督學習 vs. 遷移學習:自監督學習是一種預訓練方式,遷移學習是一個更廣義的概念,指將在一個任務上學到的知識遷移到另一個任務,自監督預訓練是實現遷移學習的重要手段之一。

重要性與影響

現代最成功的 AI 系統,無論是 GPT-4、Claude 等大型語言模型,還是 CLIP、DINO 等視覺基礎模型,其核心能力都源自大規模自監督預訓練。Yann LeCun 曾形象地將自監督學習比喻為「智慧的黑暗物質」,認為它是通往通用人工智慧的重要路徑。

中英對照與常見說法

說法 出現場合
自監督學習 台灣正式用語
自监督学习 簡體寫法
Self-Supervised Learning 英文原名
SSL 縮寫,注意這個縮寫在資安領域另指加密協定
自我監督學習 常見變體

跟監督式、非監督式的關係

監督式 自監督式 非監督式
標籤從哪來 人工標註 從資料本身自動構造 沒有標籤
訓練形式 預測標籤 預測標籤(只是標籤是造出來的) 找結構
典型產出 任務模型 通用表示,之後再微調 分群、降維結果

自監督式常被歸在非監督式底下,因為兩者都不需要人工標註。但它的訓練形式其實是監督式的:有明確的預測目標與損失函數,只是那個目標是從資料裡挖出來的。這也是它效果好的原因,它同時拿到了「不用標註」與「有明確訓練訊號」兩個好處。

常見的前置任務

文字:遮住句中部分詞讓模型猜回來(BERT 的做法)、預測下一個詞(GPT 系列的做法)。現在的大型語言模型預訓練全部屬於這一類。

影像的對比式方法:同一張圖做兩種不同的隨機變換,要求模型把兩者的表示拉近,同時把不同圖的表示推遠。代表方法有 SimCLR、MoCo。關鍵在於資料增強要夠強,增強太弱模型可以靠顏色或紋理走捷徑,學不到語意。

影像的生成式方法:遮住影像的一部分讓模型還原,代表是 MAE(Masked Autoencoder),遮住的比例常常高達 75%。

多模態:用圖文配對訓練,讓對應的圖與文在同一個空間裡靠近,CLIP 是代表。這類方法的訓練訊號來自資料的天然配對關係,同樣不需要人工標註。

為什麼它是現在的主流

資料規模的門檻不一樣。 人工標註的資料以百萬計就很了不起,未標註的資料以十億計。基礎模型能力的躍升,主要來自能吃下後者。

學到的表示比較通用。 監督式訓練學到的是「怎麼分辨這幾個類別」,容易只抓到區分那幾類需要的特徵。自監督式的目標更難也更全面,學到的表示換到別的任務上仍然好用。

標準流程是自監督預訓練加上少量標註微調:預訓練吃掉大部分算力並學會通用表示,微調只需要幾百到幾千筆標註就能達到不錯的表現。這也是它在醫療影像、工業檢測這類標註昂貴的領域特別有價值的原因。

常見問題

自監督學習和無監督學習有什麼不同?

這兩個概念常被混淆,但有本質區別。無監督學習通常指聚類(K-means)、密度估計或降維等沒有明確預測目標的方法,是在「無監督」的情況下尋找資料的內在結構。自監督學習則有明確的預測任務:只是這個任務的標籤是從資料本身自動生成的,而非人工標注。例如 BERT 預測被遮住的詞、MAE 重建被遮住的影像區域,這些都是明確的有監督預測問題,只是監督信號來自資料本身而非人工標注員。因此,自監督學習在技術實現上更接近監督學習,但在資料需求上更接近無監督學習。

為什麼 BERT 和 GPT 都屬於自監督學習,但訓練方式不同?

BERT 和 GPT 確實都是自監督預訓練模型,但採用了不同的「藉口任務」設計:BERT 使用遮罩語言建模(MLM),隨機遮住句子中的部分詞彙,要求模型同時參考左右兩側的上下文來預測被遮住的詞,屬於「雙向」語言模型,適合需要理解全文語境的任務(如文字分類、問答)。GPT 則採用自回歸語言建模(Causal LM),訓練模型依序預測下一個詞,只能看到左側歷史,屬於「單向」語言模型,更適合文字生成任務。這兩種設計各有優劣,選擇哪種取決於下游任務的性質。

自監督學習有沒有什麼限制或缺點?

自監督學習雖然強大,但並非沒有挑戰。第一,藉口任務的設計需要領域知識和大量實驗,不同的預訓練任務對下游任務的遷移效果差異很大;第二,預訓練通常需要極大規模的運算資源(大量 GPU 和能源消耗),對一般研究者而言門檻很高;第三,雖然不需要人工標注,但預訓練語料本身若存在偏見(Bias),模型就可能學到並放大這些偏見;第四,自監督學習能學到良好的通用表示,但在某些高度專業化的小型任務上,針對任務設計的監督學習方法有時仍能取得更好的效果。