命名實體識別 是什麼?

NER (Named Entity Recognition):命名實體識別 的完整解釋

從非結構化文字中自動識別並分類人名、地名、組織名等具體命名實體的 NLP 技術。

命名實體識別(Named Entity Recognition,NER)是資訊擷取(Information Extraction)領域的核心任務,也是許多 NLP 應用管線(pipeline)的起點。其目標是給定一段自然語言文字,標出其中所有的命名實體(named entity)位置與類別。

常見實體類別

不同領域的 NER 系統定義的實體類別各有不同,標準資料集(如 CoNLL-2003)通常包含:

  • PER(Person):人名,如「馬英九」「Elon Musk」
  • ORG(Organization):組織機構,如「臺灣大學」「OpenAI」
  • LOC(Location):地名,如「台北市」「Silicon Valley」
  • MISC(Miscellaneous):其他雜項,如節日、作品名稱

金融、醫療等領域則會擴充自定義類別,如藥品名、疾病名、股票代碼、法規名稱等。

標注方案

NER 的序列標注通常採用 BIO 或 BIOES 方案:

  • B(Beginning):命名實體的第一個詞元
  • I(Inside):命名實體的中間與末尾詞元
  • O(Outside):非命名實體的詞元 例如「台灣大學」的 BIO 標注為:台/B-ORG、灣/I-ORG、大/I-ORG、學/I-ORG。

技術演進

  1. 規則與詞典法(早期):人工撰寫正規表示式與實體詞典,精確率高但覆蓋率有限,維護成本高。
  2. 統計模型:隱馬可夫模型(HMM)、條件隨機場(CRF)是 2000-2015 年的主流方法,CRF 至今仍常作為模型的輸出層。
  3. 深度學習(2015 年後):BiLSTM-CRF 架構成為當時的標準方法,能自動學習上下文特徵。
  4. 預訓練語言模型(2018 年後):BERT、RoBERTa 等模型作為特徵提取器,搭配 CRF 或 Softmax 輸出層,在多數基準上大幅超越前一代方法,成為現今主流。
  5. 生成式模型(近期):GPT 系列模型可透過提示詞直接輸出結構化實體,適合低資源或快速原型場景,但一致性不如序列標注模型。

應用場景

  • 新聞媒體監控:自動擷取報導中的人物、組織、事件地點。
  • 金融分析:從財報、新聞中擷取公司名稱、財務數字、時間點。
  • 醫療資訊擷取:從病歷中識別藥品名、疾病名、手術名稱,輔助臨床決策。
  • 知識圖譜建構:NER 是三元組擷取(實體-關係-實體)的前置步驟。
  • 搜尋引擎理解:識別查詢詞中的實體類型,改善搜尋結果排序。
  • 智慧客服:從使用者訊息中擷取訂單號碼、產品名稱、日期等資訊。

評估指標

NER 評估採用精確率、召回率與 F1 分數,且通常以實體跨度(span)為單位,即一個實體的邊界與類別均正確才算正確(部分正確不計分)。

挑戰

  • 實體邊界模糊:「台大醫院」是整體還是「台大」+「醫院」?
  • 實體歧義:「蘋果」是公司名還是水果?需依上下文消歧。
  • 巢狀實體(Nested NER):「哈佛大學醫學院」包含多層組織。
  • 低資源語言:中文、泰文等缺乏分詞邊界,標注更複雜。
  • 領域遷移:通用模型在特定領域(如法律、生醫)效果可能顯著下降,需要領域適應(domain adaptation)。

NER 的評估標準與實踐建議 NER 系統上線前,建議進行「錯誤分析」:將假陽性(誤報實體)和假陰性(漏報實體)分類,識別常見失誤模式(如邊界錯誤、類別混淆),以決定下一步改善策略。在標注新資料時,應制定清晰的標注指南(annotation guideline),定義邊界案例的處理方式,並計算標注者間一致性(inter-annotator agreement,通常用 Cohen kappa 衡量)。多標籤 NER(同一文字跨越多個實體類別)和巢狀 NER 是進階挑戰,需要專門的模型架構或後處理策略來處理。

常見問題