序列標注 是什麼?

Sequence Labeling:序列標注 的完整解釋

將輸入序列中的每個元素映射到對應標籤的 NLP 任務類型,如命名實體識別、詞性標注、語音辨識等。

Sequence Labeling(序列標注)是 NLP 中最基礎的結構化預測任務之一,其方法論演進清晰地映射了 NLP 技術從統計機器學習到深度學習再到預訓練模型的整體發展軌跡。

代表性任務

命名實體識別(NER, Named Entity Recognition):識別文本中的人名、地名、機構名、時間、金額等實體,並標注其類型。例如:「蘋果公司於 2007 年發布 iPhone」→「蘋果公司」(ORG)、「2007 年」(TIME)、「iPhone」(PRODUCT)。

詞性標注(POS Tagging):為每個詞語標注其語法類別(名詞、動詞、形容詞等)。

分詞(Word Segmentation):在無明確詞界標記的語言(如中文、日文)中,識別詞彙邊界。

語意角色標記(Semantic Role Labeling, SRL):識別句子中的謂語及其論元(誰做了什麼、對誰、在哪裡、什麼時候)。

槽位填充(Slot Filling):在對話系統中,識別使用者語句中的關鍵資訊槽(如「訂明天北京到上海的機票」中的出發地、目的地、日期)。

標注體系(Tagging Scheme)

序列標注使用特定的標注格式來表達實體的邊界資訊:

BIO 格式:B(Beginning,實體開頭)、I(Inside,實體內部)、O(Outside,非實體)。例如「上海 交通 大學」標注為 B-ORG、I-ORG、I-ORG。

BIOES 格式:在 BIO 基礎上增加 E(End,實體結尾)和 S(Single,單詞實體),提供更細緻的邊界資訊,有時能提升模型學習效率。

IOB2 格式:所有實體開頭詞強制標 B,即使前一個詞也是同類實體,避免歧義。

方法演進

統計機器學習時代:

  • 隱馬可夫模型(HMM):序列標注的早期主流方法,對標籤序列建立馬可夫假設(當前標籤只依賴前一個標籤)。
  • 條件隨機場(CRF, Conditional Random Field):由 Lafferty 等人提出,直接對輸入序列和標籤序列的條件概率建模,避免 HMM 的獨立性假設,成為序列標注的強基線。

深度學習時代:

  • BiLSTM-CRF:雙向 LSTM 從兩個方向捕捉序列上下文,輸出每個位置的特徵表示,再接 CRF 層確保標籤序列的全局一致性(如防止 I 不接 B 的非法標籤序列)。這個架構在 2018 年前長期是 NER 的 SOTA。
  • BERT + CRF:以 BERT 等預訓練語言模型作為編碼器替換 BiLSTM,再接 CRF 分類頭,在各序列標注任務上大幅超越前代方法。
  • 直接分類(without CRF):現代強大的 LLM 有時省略 CRF 層,直接在每個位置做 Softmax 分類,其上下文理解能力足以隱式學習標籤間的依賴關係。

CRF 的作用

CRF(條件隨機場)在序列標注中的關鍵貢獻是引入標籤間的轉移矩陣,在解碼時強制執行全局一致的標籤序列。例如,O 後不能直接接 I(因為沒有 B 開頭),I-PER 後不能接 I-ORG(類型必須一致)。純 Softmax 在每個位置獨立決策,可能輸出無效的標籤序列;Viterbi 算法配合 CRF 的轉移分數,保證輸出全局最優且合法的標籤序列。

評估指標

序列標注通常以實體級別(而非詞語級別)的精確率(Precision)、召回率(Recall)和 F1 分數評估。只有預測的實體邊界(起止位置)和類型完全正確,才算預測正確。常用工具為 seqeval 套件。

與生成式方法的關係

大型語言模型(如 GPT 系列)可透過提示工程直接以生成方式完成 NER 等任務(輸出結構化的 JSON 格式)。與判別式序列標注模型相比,生成方式更靈活(無需固定標籤集),但延遲較高、且邊界預測精度在小型模型上可能不如 BiLSTM-CRF 等判別式方法。當前研究探索兩者的混合:用 LLM 生成候選實體,再用判別模型驗證。

常見問題