遮蔽語言模型(Masked Language Model)是什麼?

遮蔽語言模型(MLM)是一種自監督學習方法,隨機遮蔽輸入文本的部分詞語,並訓練模型預測這些被遮蔽的詞語。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Masked Language Model
主題標籤
深度學習、自然語言處理、自監督學習
考點定位
非 iPAS 核心術語
最後更新
2026/07/29
遮蔽語言模型(Masked Language Model)是什麼? 深度學習自然語言處理
術語快查

搜尋意圖: 如果你在找「遮蔽語言模型 是什麼」或「遮蔽語言模型 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 遮蔽語言模型(MLM)是一種自監督學習方法,隨機遮蔽輸入文本的部分詞語,並訓練模型預測這些被遮蔽的詞語。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有做過填空題,少掉幾個字也還是能猜出整句意思? 你可以把遮蔽語言模型想成,先把句子挖空,再讓模型把空格填回來。 它其實就是透過預測被遮蔽的詞來學語言。 這種方式很適合學上下文和雙向語意。

你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。

容易混淆

MLM vs 因果語言模型 MLM 看雙向上下文,因果語言模型通常只看前文。 一個像整句填空,一個像接龍。

MLM vs 完形填空任務 完形填空是題型,MLM 是訓練方法。 一個是考試形式,一個是學習方式。

最關鍵的區別: 題型和訓練方法不是同一件事。

記住這句就好

先把字挖掉,再逼模型補回來。

實際案例

BERT 預訓練 BERT 就常用 MLM 學到雙向上下文,讓它更懂句子語意。

文字理解模型 當你要做分類或檢索前的表徵學習,MLM 很常是前置訓練任務。

算法與應用

常見做法是隨機遮住部分 token,讓模型根據左右文預測原詞。 因為能看左右兩邊,它比單向接龍更擅長理解語境。 這也是 BERT 類模型的重要預訓練任務。

中英對照與常見說法

說法 出現場合
遮蔽語言模型 台灣正式用語
掩码语言模型 簡體寫法
Masked Language Model 英文原名
MLM 標準縮寫,注意這個縮寫在商業領域另指多層次傳銷,不同領域同名
克漏字任務、完形填空 用來說明它在做什麼的比喻說法

跟自回歸語言模型的根本差別

遮蔽語言模型(如 BERT) 自回歸語言模型(如 GPT 系列)
訓練目標 蓋住句中部分詞,預測被蓋住的是什麼 依前文預測下一個詞
看得到的上下文 左右兩邊都看得到 只看得到左邊
天生擅長 理解類任務:分類、抽取、標註 生成類任務:寫作、對話、續寫
直接拿來生成 不適合,它沒有逐字往下生成的機制 適合

一句話的區別:一個是克漏字,一個是接龍。雙向上下文是遮蔽語言模型在理解任務上長期占優的原因,也是它不能直接拿來生成的原因。

BERT 的遮蔽策略細節

BERT 隨機挑 15% 的 token 當作預測目標,但這 15% 裡面又分三種處理:

比例 處理方式 理由
80% 換成 [MASK] 特殊符號 主要的訓練訊號
10% 換成一個隨機的詞 強迫模型對每個位置都保持懷疑,不能只在看到 [MASK] 時才動腦
10% 保持原詞不動 讓模型的表示偏向真實輸入的分布

這個設計是為了處理預訓練與微調的落差:訓練時句子裡有 [MASK],實際使用時沒有。後兩種處理就是在縮小這個落差。

後續改良包括 全詞遮蔽(whole word masking),把同一個詞被切開的多個子詞一起遮住,避免模型靠半個詞猜另外半個;以及 SpanBERT 的連續片段遮蔽,讓任務更難也更貼近下游的抽取需求。

現在還用得到嗎

大型語言模型興起後,生成任務幾乎都用自回歸架構。但遮蔽語言模型在幾個地方仍是首選:需要句向量的場景(檢索、相似度比對,BERT 系列的雙向表示品質好且模型小)、序列標註(命名實體識別、詞性標註)、以及延遲與成本敏感的線上分類服務。一個幾億參數的編碼器模型能在毫秒級完成分類,這是大型語言模型做不到的。

情境判斷

Q1(直覺題): 句子中間少掉一個詞,模型要根據前後文猜回來,這像什麼任務?

這就是遮蔽語言模型的典型訓練方式。

Q2(判斷題): 只要是填空題,就一定代表模型用了 MLM 嗎?

不一定,填空是題型,MLM 是一種訓練策略。

常見問題

MLM 為什麼能學雙向語意?

因為它在預測空格時可以同時看左邊和右邊的上下文。

MLM 一定要遮很多字嗎?

不一定,遮太多會太難,遮太少又學不到足夠上下文。

MLM 和 BERT 有什麼關係?

BERT 最經典的預訓練方式之一就是 MLM。