命名實體識別(NER (Named Entity Recognition))是什麼?

從非結構化文字中自動識別並分類人名、地名、組織名等具體命名實體的 NLP 技術。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
NER (Named Entity Recognition)
主題標籤
序列標注、資訊擷取、自然語言處理
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
命名實體識別(NER (Named Entity Recognition))是什麼? 序列標注資訊擷取
術語快查

搜尋意圖: 如果你在找「命名實體識別 是什麼」或「命名實體識別 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從非結構化文字中自動識別並分類人名、地名、組織名等具體命名實體的 NLP 技術。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從非結構化文字中自動識別並分類人名、地名、組織名等具體命名實體的 NLP 技術。

命名實體識別(Named Entity Recognition,NER)是資訊擷取(Information Extraction)領域的核心任務,也是許多 NLP 應用管線(pipeline)的起點。其目標是給定一段自然語言文字,標出其中所有的命名實體(named entity)位置與類別。

常見實體類別

不同領域的 NER 系統定義的實體類別各有不同,標準資料集(如 CoNLL-2003)通常包含:

  • PER(Person):人名,如「馬英九」「Elon Musk」
  • ORG(Organization):組織機構,如「臺灣大學」「OpenAI」
  • LOC(Location):地名,如「台北市」「Silicon Valley」
  • MISC(Miscellaneous):其他雜項,如節日、作品名稱

金融、醫療等領域則會擴充自定義類別,如藥品名、疾病名、股票代碼、法規名稱等。

標注方案

NER 的序列標注通常採用 BIO 或 BIOES 方案:

  • B(Beginning):命名實體的第一個詞元
  • I(Inside):命名實體的中間與末尾詞元
  • O(Outside):非命名實體的詞元 例如「台灣大學」的 BIO 標注為:台/B-ORG、灣/I-ORG、大/I-ORG、學/I-ORG。

技術演進

  1. 規則與詞典法(早期):人工撰寫正規表示式與實體詞典,精確率高但覆蓋率有限,維護成本高。
  2. 統計模型:隱馬可夫模型(HMM)、條件隨機場(CRF)是 2000-2015 年的主流方法,CRF 至今仍常作為模型的輸出層。
  3. 深度學習(2015 年後):BiLSTM-CRF 架構成為當時的標準方法,能自動學習上下文特徵。
  4. 預訓練語言模型(2018 年後):BERT、RoBERTa 等模型作為特徵提取器,搭配 CRF 或 Softmax 輸出層,在多數基準上大幅超越前一代方法,成為現今主流。
  5. 生成式模型(近期):GPT 系列模型可透過提示詞直接輸出結構化實體,適合低資源或快速原型場景,但一致性不如序列標注模型。

應用場景

  • 新聞媒體監控:自動擷取報導中的人物、組織、事件地點。
  • 金融分析:從財報、新聞中擷取公司名稱、財務數字、時間點。
  • 醫療資訊擷取:從病歷中識別藥品名、疾病名、手術名稱,輔助臨床決策。
  • 知識圖譜建構:NER 是三元組擷取(實體-關係-實體)的前置步驟。
  • 搜尋引擎理解:識別查詢詞中的實體類型,改善搜尋結果排序。
  • 智慧客服:從使用者訊息中擷取訂單號碼、產品名稱、日期等資訊。

評估指標

NER 評估採用精確率、召回率與 F1 分數,且通常以實體跨度(span)為單位,即一個實體的邊界與類別均正確才算正確(部分正確不計分)。

挑戰

  • 實體邊界模糊:「台大醫院」是整體還是「台大」+「醫院」?
  • 實體歧義:「蘋果」是公司名還是水果?需依上下文消歧。
  • 巢狀實體(Nested NER):「哈佛大學醫學院」包含多層組織。
  • 低資源語言:中文、泰文等缺乏分詞邊界,標注更複雜。
  • 領域遷移:通用模型在特定領域(如法律、生醫)效果可能顯著下降,需要領域適應(domain adaptation)。

NER 的評估標準與實踐建議 NER 系統上線前,建議進行「錯誤分析」:將假陽性(誤報實體)和假陰性(漏報實體)分類,識別常見失誤模式(如邊界錯誤、類別混淆),以決定下一步改善策略。在標注新資料時,應制定清晰的標注指南(annotation guideline),定義邊界案例的處理方式,並計算標注者間一致性(inter-annotator agreement,通常用 Cohen kappa 衡量)。多標籤 NER(同一文字跨越多個實體類別)和巢狀 NER 是進階挑戰,需要專門的模型架構或後處理策略來處理。

常見問題

NER 和關鍵字擷取(Keyword Extraction)有什麼不同?

兩者都在從文字中找出重要詞彙,但目的與方法不同。關鍵字擷取偏向找出代表文章主題的核心詞彙,不一定是命名實體,也可能是抽象概念詞(如「機器學習」「永續發展」);NER 則專注於識別具有明確現實指涉的命名實體(人名、地名、組織名等),並且必須標注其精確邊界和類別。兩者可互補:先用 NER 找出實體,再結合關鍵字擷取進行更全面的文件分析。

在中文環境下做 NER 特別困難嗎?

相較於英文,中文 NER 確實面臨額外挑戰。最主要的問題是中文沒有天然的詞彙邊界(英文有空格),因此需要先進行中文分詞(word segmentation),而分詞錯誤會直接影響 NER 品質。此外,中文人名通常只有兩三個字,容易與普通詞彙混淆;地名也存在大量簡稱和別稱。現代做法通常採用字元級(character-level)的序列標注,不依賴分詞,搭配 BERT-base-chinese 等預訓練模型,在標準資料集上已能取得相當好的效果。

如果我想快速在自己的資料上做 NER,有什麼工具推薦?

有幾個方向可以選擇:若需要快速原型且資料量不大,可以用 OpenAI 或 Anthropic 的 LLM API 直接透過提示詞擷取實體,格式化輸出為 JSON,省去標注成本。若需要在本地部署或處理大量文件,spaCy 是功能完整的 NLP 函式庫,提供預訓練的 NER 模型並支援自定義訓練;HuggingFace Transformers 上也有大量針對各語言和領域微調的 NER 模型可直接使用。若領域特殊(如醫療、法律),建議在通用模型基礎上用少量領域標注資料進行微調。