缺失標記(Missing Token)是什麼?

語言模型處理序列時用於表示遮蔽或缺失位置的特殊符號,常見於遮罩語言模型訓練與填空推論任務。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Missing Token
主題標籤
自然語言處理、遮罩語言模型、BERT
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
缺失標記(Missing Token)是什麼? 自然語言處理遮罩語言模型
術語快查

搜尋意圖: 如果你在找「缺失標記 是什麼」或「缺失標記 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 語言模型處理序列時用於表示遮蔽或缺失位置的特殊符號,常見於遮罩語言模型訓練與填空推論任務。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

語言模型處理序列時用於表示遮蔽或缺失位置的特殊符號,常見於遮罩語言模型訓練與填空推論任務。

Missing Token(缺失標記)是自然語言處理與大型語言模型領域中一個基礎但重要的概念,貫穿了模型預訓練、資料前處理以及推論應用等多個環節。

概念起源與發展背景

「遮罩語言模型」(Masked Language Model,MLM)的訓練目標首先由 Google 於 2018 年在 BERT(Bidirectional Encoder Representations from Transformers)論文中系統化提出。其核心思想源自傳統語言學的完形填空(Cloze Task):給定一段含空格的句子,要求讀者填入最適合的詞彙。BERT 將此概念數位化,在訓練資料中隨機將約 15% 的 token 替換為 [MASK] 符號,令模型學習依賴左右兩側的雙向上下文來預測缺失位置的原始詞彙。這個設計使 BERT 系列模型得以學到遠比單向 GPT 架構更豐富的語境關係。

Missing Token 的三種型態

在實際應用中,Missing Token 可以分為三種型態。第一種是訓練期遮罩(Training Mask),即在 MLM 預訓練時人為製造的缺失,讓模型主動學習填補能力。第二種是推論期遮罩(Inference Mask),在實際使用場景中主動將特定位置設為空白,要求模型生成該位置的最佳候選,常見於自動填表、文章摘要生成與對話補全。第三種是資料品質造成的缺失(Data Quality Missing),指原始訓練語料中因 OCR 識別錯誤、格式轉換損毀或人工標注疏漏所導致的非預期空缺,若未妥善處理可能導致模型學到錯誤的語言模式。

MLM 預訓練的遮罩策略細節

BERT 的遮罩策略並非單純將所有選取 token 替換為 [MASK],而採用了三階段混合策略以降低訓練與推論之間的分佈落差:約 80% 的選取位置以 [MASK] 替換;約 10% 替換為隨機詞彙(即使替換後句子語法可能有誤);剩餘 10% 保留原詞不變。這個設計讓模型無法在看到 [MASK] 符號時才「啟動」預測模式,而是必須對每一個 token 位置都保持語境推理能力。後續如 RoBERTa 的研究更進一步採用動態遮罩(Dynamic Masking),每次訓練 epoch 使用不同的隨機遮罩組合,增加訓練資料的多樣性。

在 iPAS 考試情境中的重要性

在 iPAS AI 應用規劃師中級考試中,Missing Token 相關概念主要考核應試者對 MLM 架構與自回歸(Autoregressive)語言模型的區別理解。考生需要能辨識:MLM(如 BERT)適合需要理解全文語境的分類、問答任務;而自回歸模型(如 GPT 系列)適合文字生成任務。理解 Missing Token 機制有助於應試者根據業務需求選擇正確的預訓練模型架構。

實務應用場景

Missing Token 技術在業務端有多種落地應用。在文件自動補全系統中,使用者填寫表單時可利用 MLM 根據已輸入欄位的語境自動建議缺失欄位的內容。在語料資料清理管線中,可訓練小型 MLM 模型偵測並修復因 OCR 或格式轉換產生的異常 token。在對話系統的意圖識別前處理中,若輸入文本含有口語省略或拼寫錯誤,可先用 MLM 進行還原再送入下游分類器。此外,在跨語言翻譯對齊中,Missing Token 概念也被用來處理兩種語言對應詞彙長度不一致時的對位問題。

與相關概念的區辨

Missing Token 容易與三個相近概念混淆。第一是 Padding Token(填充標記),其目的是將長度不一的序列填充至相同長度以便批次處理,並非代表「缺失」的語意訊息,模型透過 Attention Mask 得知哪些位置是填充而應忽略。第二是 Unknown Token(未知標記,[UNK]),代表詞彙表中未收錄的字詞,是詞彙覆蓋問題而非位置遮罩問題。第三是 Special Token(特殊標記),如 [CLS]、[SEP],是用於標記句首、句尾或分隔兩個句子的功能性標記。四者功能各異,在設計 NLP 管線時需要明確區分。

現代大型語言模型中的演進

隨著大型語言模型(LLM)的發展,純 MLM 架構在生成任務上的限制逐漸顯現,但 Missing Token 的概念延伸到了更廣泛的應用。例如,Diffusion Language Model 將 Missing Token 從固定位置的 [MASK] 擴展為可迭代去噪的連續語意空間;Fill-in-the-Middle(FIM)訓練策略讓 GPT 類模型也具備中間填空能力,兼顧前綴與後綴語境,在程式碼補全(如 GitHub Copilot)中廣泛採用。這些演進都以 Missing Token 的基礎概念為出發點,根據不同任務需求加以調整與擴展。

小結

Missing Token 是連結語言學完形概念與現代深度學習訓練策略的橋梁。從 BERT 的 [MASK] 預訓練到 FIM 程式碼補全,從資料清理到自動填表,理解 Missing Token 的機制與變體,是掌握 NLP 模型設計與選型的重要基礎。

常見問題

Missing Token 和 Padding Token 有什麼差異?

Missing Token([MASK])代表「此位置有真實詞彙但被刻意遮蔽或未知」,模型需預測其內容,攜帶語意訊息。Padding Token 則純粹是為了將批次中長度不同的序列補齊至相同長度的佔位符,不攜帶任何語意,模型透過 Attention Mask 矩陣得知哪些位置是填充並予以忽略。在設計 NLP 資料前處理管線時,兩者必須明確分開處理,混用會導致模型訓練時計算錯誤的損失值。

為什麼 BERT 的遮罩策略不全部用 [MASK] 替換,而要混入隨機詞和原詞?

若 100% 使用 [MASK] 替換,模型在推論時永遠不會看到 [MASK] 符號(因為推論時輸入是真實文字),造成訓練與推論之間的分佈落差(Pre-train/Fine-tune Discrepancy)。BERT 論文採用三階段混合策略(80% [MASK]、10% 隨機詞、10% 原詞),讓模型在看到任意 token 時都需保持語境推理能力,而非只在看到 [MASK] 時才啟動,從而提升表示學習的穩健性。

Fill-in-the-Middle(FIM)與傳統 MLM 的 Missing Token 有何不同?

傳統 MLM(如 BERT)的 Missing Token 是在序列內部隨機遮蔽多個離散位置,模型以雙向編碼器一次性預測所有被遮罩的 token,適合理解任務。FIM(填中間)是 GPT 類自回歸模型的訓練策略,將輸入重排為「前綴 + 後綴 → 中間段」的格式,讓單向生成模型同時利用目標位置前後的語境生成完整中間段,特別適合程式碼補全場景,如在函式開頭與結尾已知的情況下自動補全函式主體。