內在評估 是什麼?

Intrinsic Evaluation:內在評估 的完整解釋

在特定子任務上直接評估模型或表示的質量,如詞向量的類比任務,不涉及下游應用。

內在評估(Intrinsic Evaluation)與外在評估(Extrinsic Evaluation)是 NLP 系統評估的兩個互補維度。理解兩者的區別、適用場景與局限對於科學評估 AI 系統至關重要。

核心概念

內在評估直接在某個特定的子任務或基準上評測模型或表示,該任務本身是「目的」而非「手段」。例如:

  • 詞向量:在詞相似度數據集上計算預測相似度與人工標注相似度的相關性。
  • 語言模型:計算困惑度(Perplexity)或語料的對數機率。
  • 句向量:在 SentEval 基準上測試多個下游任務的表現。

這些評估不涉及實際應用,而是抽象地衡量模型對某種語言現象的捕捉能力。

詞向量評估的典型基準

詞相似度任務(Word Similarity)

給定詞對集合,人工標注者為每對詞評分相似度(通常 0–10 分)。模型需要計算詞向量的相似度(如餘弦相似度),與人工評分的相關性(通常用斯皮爾曼相關係數或皮爾森相關係數衡量)衈高越好。常見基準包括:

  • RareWord(RW):353 對常用詞,訓練測試詞向量的一般能力。
  • WordSim-353:常見詞對,區分相關性(relevance)和相似性(similarity)。
  • SimLex-999:強調詞義相似度而非關聯性(「tiger」和「tiger」相似度 10,「tiger」和「tiger cub」關聯度高但相似度低)。

詞類比任務(Word Analogy)

給定 A–B 和 C 的類比,預測 D。例如:Paris – France = Bangkok – ? → Thailand。Google Word2Vec 發布的經典基準包含 19,544 個類比,分為語義類比(如首都–國家、性別、形容詞–副詞)和句法類比(如比較級、複數)。模型計算 vec(C) + vec(B) – vec(A) 後,找最近鄰詞(應該是 D)。

類比任務對詞向量的要求很高,因為它涉及多維的語義操作。Word2Vec 和 GloVe 在類比任務上的表現成為評估詞向量質量的重要指標。

語言模型的內在評估

困惑度(Perplexity)

對於語言模型,困惑度是最常用的內在指標。定義為: PP = exp(-1/N Σ log P(w_i)) 或 PP = (∏ P(w_i))^(-1/N)

其中 N 是測試集的詞數,P(w_i) 是模型對第 i 個詞的預測機率。困惑度可解釋為模型平均「困惑」程度:詞表中有多少個等概率的詞能達到相同的損失。困惑度越低越好。

例如,若模型在句子「貓坐在墊子上」中:

  • P(貓) = 0.1(低,模型認為「貓」不太可能作為句首)
  • P(坐 | 貓) = 0.2(給定「貓」,預測「坐」的機率)
  • ...

困惑度大約是 5 時,表示平均而言模型「對 5 個等概率的詞一樣困惑」。

困惑度在比較同類模型(如不同大小的 LSTM)時有用,但跨模型比較需謹慎(預處理、詞表大小、訓練資料差異都影響困惑度)。

BLEU、ROUGE、METEOR(序列到序列任務)

對於機器翻譯、文摘、問答等生成任務,基於參考答案的自動評估指標:

  • BLEU(Bilingual Evaluation Understudy):計算模型生成的 n-gram 與參考的 n-gram 重疊比例。
  • ROUGE(Recall-Oriented Understudy for Gisting Evaluation):類似但更關注召回率,常用於文摘評估。
  • METEOR:利用詞幹、同義詞、語義相似度等高階特徵改進 BLEU。

這些指標速度快、可重複,但無法完美衡量生成質量(如流暢度、創意性),往往與人工評分的相關性中等(0.3–0.6)。

內在評估與外在評估的關係

內在評估的根本問題是「與下游應用相關性弱」。一個在詞類比上表現優秀的詞向量,不一定在文本分類或情感分析上表現好。類似地,低困惑度的語言模型,在實際對話或翻譯應用中可能性能不佳。

Empirical 證據表明:

  • 詞相似度與詞類比之間相關性較好(都反映靜態語義),但與下游任務的相關性參差不齊。
  • 困惑度與翻譯質量、問答準確度的相關性中等(0.4–0.7)。
  • BLEU 與人工評估的相關性甚至不足 0.5,尤其在新領域或低資源語言。

理由是:內在任務往往簡化或片面地反映語言現象,而真實應用往往需要綜合多個語言層面的理解。例如,詞類比強調語義向量操作,但文本分類需要的是鯉序列建模能力,靜態詞向量可能不夠。

內在評估的優點與缺點

優點:

  • 快速且可重複:無需訓練下游任務的模型。
  • 易於診斷:如果模型在詞相似度上失敗,表明詞向量品質有問題。
  • 通用性:同一份詞向量可在多個內在任務上評估。

缺點:

  • 與實際應用的相關性弱:內在優秀不保證外在優秀。
  • 片面性:只衡量特定方面(如語義),忽視其他(如句法)。
  • 人工標注成本:許多基準需要專家手工標注(詞相似度、類比)。
  • 天花板與偏差:某些基準的 inter-rater agreement 本身就低(如詞相似度,人與人間相關性 0.7–0.8)。

現代 NLP 的評估實踐

當代 NLP 研究越來越重視外在評估(在真實下游任務上測試),因為:

  • 大型語言模型(BERT、GPT)的預訓練是通用的,不針對特定內在任務。
  • 研究者發現內在指標改進不一定帶來外在性能提升。
  • 實際應用關心的是最終用戶體驗,而非模型內部指標。

CONLL、GLUE、SuperGLUE、SQuAD 等外在評估基準成為新興主流。不過,內在評估仍有價值:快速診斷、對比同類模型、資源受限時的務實選擇。

典型用法

開發 NLP 系統時的建議流程:

  1. 在內在任務上快速篩選備選模型(如從 10 個詞向量中選 3 個)。
  2. 在外在任務上仔細評估最終候選(在真實應用場景測試)。
  3. 若外在評估指標不理想,回到內在評估診斷瓶頸(詞義相似度?句法理解?)。
  4. 迭代改進。

常見問題