共指消解(Coreference)是什麼?

自動識別文本中指稱相同實體的不同表達式(如代詞、定指表達式),並將其分組聚集的任務。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Coreference
主題標籤
自然語言處理、指代消解、實體追蹤
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
共指消解(Coreference)是什麼? 自然語言處理指代消解
術語快查

搜尋意圖: 如果你在找「共指消解 是什麼」或「共指消解 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 自動識別文本中指稱相同實體的不同表達式(如代詞、定指表達式),並將其分組聚集的任務。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

自動識別文本中指稱相同實體的不同表達式(如代詞、定指表達式),並將其分組聚集的任務。

共指消解(Coreference Resolution)是從文本中提取實體指稱關係的核心任務,對後續的深層文本理解至關重要。

基本概念

共指與指稱(Coreference vs. Reference)

  • 指稱(Reference):語言表達指向現實世界的對象或概念
  • 共指(Coreference):多個語言表達指向同一對象

例如「John 進城了。他買了一本書。」中,"John" 和 "他" 共指同一人物。

共指形式

  1. 代詞共指

    • 人稱代詞:"he", "she", "it", "they"
    • 指示代詞:"this", "that"
    • 相對代詞:"who", "which"
  2. 定指名詞短語共指

    • "the president" → "the chief executive"
    • "the museum" → "the building"
  3. 專有名詞重複

    • "Barack Obama" → "Obama" → "Mr. President"
  4. 零指代(Zero Pronoun)

    • 特別在亞洲語言中常見,如中文可省略主語
    • "小王買了一本書。[他] 很喜歡。" 中方括號內可省略

共指鏈(Coreference Chains)

文本中所有指稱同一實體的表達式組成一個共指鏈:

  • 鏈ID:PERSON-1
  • 成員:[John]₁, [he]₁, [his]₁, [the man]₁

評估指標

  1. Link-based 指標

    • 精確率(Precision):正確的共指對數 / 系統產出的共指對數
    • 召回率(Recall):正確的共指對數 / 黃金標準的共指對數
  2. Cluster-based 指標

    • B³、MUC、CEAF 等評估整個共指鏈的正確性
    • 考慮局部匹配(partial matches)的評分
  3. 現代評估

    • CoNLL 指標:MUC、B³、CEAF 的平均 F1 分數

分析方法的演進

  1. 規則與啟發式方法(1980-2000)

    • 基於詞彙相似度、距離、性數一致性的規則
    • 精度高但覆蓋率低,難以處理複雜情況
  2. 統計與機器學習方法(2000-2015)

    • 將共指消解建模為二分類問題(兩表達式是否共指)
    • 提取詞彙、句法、語義、discourse 特徵
    • 缺點:特徵工程耗時,難以捕捉深層語義
  3. 神經網路方法(2015-2019)

    • 端到端神經網路:自動提取上下文表徵
    • Bi-LSTM、attention 機制改善長距離依賴
    • 聯合模型:同時進行詞性標注、NER、共指消解
  4. 預訓練模型時代(2019 至今)

    • BERT、RoBERTa 提供高質量上下文表徵
    • Span-pair 模型:計算所有可能的提及對(mentions)的共指機率
    • Joint 模型:同時進行提及邊界檢測與共指聚集
    • 現代最佳模型在 OntoNotes 數據集上達 79% CoNLL F1

技術細節

提及檢測(Mention Detection)

共指消解的第一步是識別所有可能的提及(mentions):

  • 名詞短語(NP):"the dog", "Mary"
  • 代詞:"he", "it", "they"
  • 命名實體:"John", "Microsoft"

提及邊界檢測可基於依存分析、成分分析或神經網路直接預測。

共指聚集(Coreference Clustering)

給定提及集合,需決定哪些提及共指:

  • 貪心聚集:逐個提及,與歷史提及找最相似者相連
  • 全局聚集:同時考慮所有提及,優化整體聚集

評分函數

評估兩提及的共指機率,融合多個信號:

  • 詞彙相似度(詞彙表匹配、嵌入相似度)
  • 文法相容性(性數、格的一致性)
  • 語義相容性(實體類型匹配)
  • 距離(通常提及距離越遠,共指機率越低)
  • Discourse 信號(焦點理論、中心化理論)

應用場景

  1. 文件理解與摘要 共指消解使摘要系統能識別句子間的實體連貫性,生成邏輯清晰的摘要。

  2. 問答系統 理解問題的指稱對象,在文件中定位答案時需解析共指。

  3. 資訊擷取 識別關係中的論元指稱,如 "John and Mary met. He proposed to her." 中正確識別 he=John, her=Mary。

  4. 機器翻譯 源語言共指消解有助於保持譯文的指稱一致性。

  5. 事件抽取 識別同一事件的多種表述,如 "acquisition", "bought", "purchase" 指稱同一事件類型。

  6. 故事理解與對話系統 跟蹤角色與事件的演進,理解複雜敘述與對話脈絡。

當代挑戰

  1. 長文本與遠距指稱 實體在文本早期引入,許多句後才再次提及,模型需強大的長距離依賴建模。

  2. 歧義與多解析 "The bank manager met the company director. She is famous." 中 she 指誰不確定。

  3. 暗指與隱含共指 "The company was founded in 1990. It has grown rapidly." 中 It 隱喻指代公司;"I like the book. The writing is excellent." 中指代部分而非整體。

  4. 跨語言差異 零代詞語言(中日韓)、格系統豐富的語言(俄語、德語)共指消解規律差異大。

  5. 領域與文體適應 新聞、文學、科技文本的共指模式不同;社群媒體的非標準語言增加難度。

實踐建議

  1. 評估應用對共指準度的需求。某些應用(如對話系統)對長距離共指更敏感。
  2. 使用預訓練模型結合領域特定微調,常能達到 75%+ CoNLL F1。
  3. 人機協作:高自信度的共指(近距、詞彙完全匹配)自動處理,邊界案例轉介人工。
  4. 進行詳細錯誤分析:區分提及邊界誤差、距離誤差、類型誤差,優先改善影響最大的類別。
  5. iPAS 考試中,共指消解通常與文件理解、資訊擷取相關,掌握核心概念與常見失誤模式有助於備考。

常見問題

為什麼說共指消解是「先有雞還是有蛋」的問題?

共指消解需要先識別提及(mention detection),但正確的提及邊界本身需要了解指稱意圖(哪些詞組是真正的提及)。兩者相互依賴,難以完全分離。現代聯合模型同時進行兩個任務,透過共享表徵與多任務學習改善。

怎樣處理文學作品中的複雜共指?

文學作品常用隱喻、擬人、暗指等修辭手法,共指邊界模糊。除了提升模型強度外,可結合文學知識圖譜、角色關係圖等背景知識,或在標注階段制定清晰的標注指南明確邊界案例處理方式。最後仍需人工審核關鍵共指。

零代詞語言的共指消解為什麼特別難?

零代詞語言(中日韓)中,主語、賓語等論元常被省略,提及檢測本身變成重大挑戰。模型需在序列中插入隱含提及,這要求對語法結構與論元結構的深入理解。現有資源(標注語料、模型)也相對缺乏,跨語言遷移效果有限。