搜尋意圖: 如果你在找「遮蔽語言模型 是什麼」或「遮蔽語言模型 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 遮蔽語言模型(MLM)是一種自監督學習方法,隨機遮蔽輸入文本的部分詞語,並訓練模型預測這些被遮蔽的詞語。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
你有沒有做過填空題,少掉幾個字也還是能猜出整句意思? 你可以把遮蔽語言模型想成,先把句子挖空,再讓模型把空格填回來。 它其實就是透過預測被遮蔽的詞來學語言。 這種方式很適合學上下文和雙向語意。
你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。
容易混淆
MLM vs 因果語言模型 MLM 看雙向上下文,因果語言模型通常只看前文。 一個像整句填空,一個像接龍。
MLM vs 完形填空任務 完形填空是題型,MLM 是訓練方法。 一個是考試形式,一個是學習方式。
最關鍵的區別: 題型和訓練方法不是同一件事。
記住這句就好
先把字挖掉,再逼模型補回來。
實際案例
BERT 預訓練 BERT 就常用 MLM 學到雙向上下文,讓它更懂句子語意。
文字理解模型 當你要做分類或檢索前的表徵學習,MLM 很常是前置訓練任務。
算法與應用
常見做法是隨機遮住部分 token,讓模型根據左右文預測原詞。 因為能看左右兩邊,它比單向接龍更擅長理解語境。 這也是 BERT 類模型的重要預訓練任務。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 遮蔽語言模型 | 台灣正式用語 |
| 掩码语言模型 | 簡體寫法 |
| Masked Language Model | 英文原名 |
| MLM | 標準縮寫,注意這個縮寫在商業領域另指多層次傳銷,不同領域同名 |
| 克漏字任務、完形填空 | 用來說明它在做什麼的比喻說法 |
跟自回歸語言模型的根本差別
| 遮蔽語言模型(如 BERT) | 自回歸語言模型(如 GPT 系列) | |
|---|---|---|
| 訓練目標 | 蓋住句中部分詞,預測被蓋住的是什麼 | 依前文預測下一個詞 |
| 看得到的上下文 | 左右兩邊都看得到 | 只看得到左邊 |
| 天生擅長 | 理解類任務:分類、抽取、標註 | 生成類任務:寫作、對話、續寫 |
| 直接拿來生成 | 不適合,它沒有逐字往下生成的機制 | 適合 |
一句話的區別:一個是克漏字,一個是接龍。雙向上下文是遮蔽語言模型在理解任務上長期占優的原因,也是它不能直接拿來生成的原因。
BERT 的遮蔽策略細節
BERT 隨機挑 15% 的 token 當作預測目標,但這 15% 裡面又分三種處理:
比例 處理方式 理由 80% 換成 [MASK] 特殊符號 主要的訓練訊號 10% 換成一個隨機的詞 強迫模型對每個位置都保持懷疑,不能只在看到 [MASK] 時才動腦 10% 保持原詞不動 讓模型的表示偏向真實輸入的分布 這個設計是為了處理預訓練與微調的落差:訓練時句子裡有 [MASK],實際使用時沒有。後兩種處理就是在縮小這個落差。
後續改良包括 全詞遮蔽(whole word masking),把同一個詞被切開的多個子詞一起遮住,避免模型靠半個詞猜另外半個;以及 SpanBERT 的連續片段遮蔽,讓任務更難也更貼近下游的抽取需求。
現在還用得到嗎
大型語言模型興起後,生成任務幾乎都用自回歸架構。但遮蔽語言模型在幾個地方仍是首選:需要句向量的場景(檢索、相似度比對,BERT 系列的雙向表示品質好且模型小)、序列標註(命名實體識別、詞性標註)、以及延遲與成本敏感的線上分類服務。一個幾億參數的編碼器模型能在毫秒級完成分類,這是大型語言模型做不到的。
情境判斷
Q1(直覺題): 句子中間少掉一個詞,模型要根據前後文猜回來,這像什麼任務?
Q2(判斷題): 只要是填空題,就一定代表模型用了 MLM 嗎?
常見問題
MLM 為什麼能學雙向語意?
因為它在預測空格時可以同時看左邊和右邊的上下文。
MLM 一定要遮很多字嗎?
不一定,遮太多會太難,遮太少又學不到足夠上下文。
MLM 和 BERT 有什麼關係?
BERT 最經典的預訓練方式之一就是 MLM。