成分句法分析 是什麼?

Constituency Parsing:成分句法分析 的完整解釋

將句子分解為層級詞組結構,建構樹形解析樹以顯示詞語與詞組的組成與支配關係。

成分句法分析(Constituency Parsing)是將自然語言句子分解為層級成分的過程,是理解句子語法結構的經典方法。

基本概念

成分與詞組(Constituents & Phrases)

成分指能作為一個單位被移動、替代或刪除的詞語或詞組。例如「那個在山頂上的紅房子」可作為單個成分被替代為「它」,顯示這整個短語是一個成分。

常見詞組類型(按詞性表示):

  • NP(名詞短語):"the quick brown fox"
  • VP(動詞短語):"saw the cat"
  • AP(形容詞短語):"very happy"
  • PP(介詞短語):"in the house"
  • S(句子):完整的主謂結構

解析樹(Parse Tree)

S(句子)為根,逐層分解:

         S
       / | \
      NP VP NP
     /|   \  |
    Det N  V Det N
    |  |  |  |  |
   The cat saw a mouse

詞性標註(Part-of-Speech Tagging)與基礎成分

成分分析依賴準確的詞性標籤(名詞、動詞、形容詞等),現代系統多併行進行。

分析方法的演進

  1. 文法規則導向(1960-1990) 手工撰寫上下文無關文法(CFG)規則,精度高但規則爆炸、維護困難。

  2. 概率上下文無關文法(PCFG, 1990-2010) 為每條文法規則賦予機率,使用 CKY(Cocke-Kasami-Younger)演算法進行最大機率分析。

  • 優點:訓練簡單,計算高效
  • 缺點:無法精確捕捉長距離依賴、詞彙選擇的條件機率
  1. 詞典化 PCFG(Lexicalized PCFG, 2000-2010) Klein & Manning 等引入詞彙條件,改進機率估計,但計算複雜度上升。

  2. 神經網路分析器(2015 年後)

  • 轉移系統分析器(Transition-Based):貪心地進行 shift、left-arc、right-arc 操作逐步構造解析樹。特點是高效但可能錯過全局最優。
  • 圖分析器(Graph-Based):計算所有可能樹的分數,選擇最高分者,保證全局最優但計算耗時。
  • 基於 Span 的分析器:直接預測每個跨度(span)是否為成分及其標籤,無需約束樹結構,計算簡便。
  1. Transformer 時代(2019 至今) BERT、GPT 等預訓練模型提供強大的上下文表徵,結合簡單解碼層(如雙仿射分類器預測跨度成分性)。

重要特性

覆蓋性與分析歧義

多數句子在不同分析方法下有多個合法解析樹。例如「I saw the man with the telescope":

  • 讀法 1:(我用望遠鏡看那個人)
  • 讀法 2:(我看那個拿著望遠鏡的人)

處理方法:(1)返回概率最高的單一分析;(2)返回 k-best 解析;(3)建造分析森林(packed forest)隱式表示所有解析。

評估指標

  • Unlabeled Recall / Precision:忽略詞組標籤,只判斷邊界正確性
  • Labeled Recall / Precision:同時考慮標籤
  • 括號交叉率(Crossing Brackets):預測樹與黃金樹的結構衝突數
  • 現代最佳模型在 PTB(Penn Treebank)標準測試集上達 96%+ F1

應用場景

  1. 語法檢查與語言教育 識別句子的語法結構,檢測違反文法規則的成分組合。

  2. 文本簡化與改寫 分析複雜句結構,識別可簡化或重組的成分(如從句)。

  3. 機器翻譯 源語言的成分結構可指導譯文的詞序與成分組合。

  4. 語義角色標注(SRL) 成分結構幫助定位論元邊界與層級關係。

  5. 信息擷取與文件理解 識別主句與從句,提取關鍵成分。

  6. 風格與可讀性分析 較複雜的成分結構(深樹、長成分)通常對應更複雜的句式。

成分分析 vs. 依存分析

特性 成分分析 依存分析
節點 詞組與詞語 詞語
成分支配 修飾與依存
層級 多層(詞→小短語→大短語→句) 扁平(單層詞語依存)
直觀性 符合文法教學,易於人工檢驗 對語義應用更直觀
計算複雜度 通常較高(指數級) 通常較低(多項式級)

當代挑戰

  1. 長句與複雜結構 Tree 深度增加導致分析難度指數上升;深層變壓器模型的長序列注意力也面臨性能下降。

  2. 跨語言標準不一 不同語言的成分結構習慣差異大,難以建立通用標準。中文的分析標準與英文差異顯著。

  3. 領域與風格適應 新聞語料與社群媒體文本的成分分析模型準度差異大,領域遷移需額外微調。

  4. 稀有現象處理 協調結構(coordination)、省略、非標準文法等邊界案例仍是難題。

實踐建議

  1. 對於應用,評估是否需要完整成分樹(資訊擷取、風格分析)還是依存結構(SRL、翻譯)足夠。
  2. 使用預訓練模型的成分分析往往足夠(spaCy、Stanford CoreNLP、Berkeley Neural Parser),除非領域特性特殊。
  3. 進行人工評審時,重點檢查長成分、協調結構、從句邊界等易錯項。
  4. iPAS 考試中,成分分析通常在理解複雜句式、教育應用等場景出現,掌握基本分析方法有助於解題。

常見問題