搜尋意圖: 如果你在找「內在評估 是什麼」或「內在評估 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 在特定子任務上直接評估模型或表示的質量,如詞向量的類比任務,不涉及下游應用。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
在特定子任務上直接評估模型或表示的質量,如詞向量的類比任務,不涉及下游應用。
內在評估(Intrinsic Evaluation)與外在評估(Extrinsic Evaluation)是 NLP 系統評估的兩個互補維度。理解兩者的區別、適用場景與局限對於科學評估 AI 系統至關重要。
核心概念
內在評估直接在某個特定的子任務或基準上評測模型或表示,該任務本身是「目的」而非「手段」。例如:
- 詞向量:在詞相似度數據集上計算預測相似度與人工標注相似度的相關性。
- 語言模型:計算困惑度(Perplexity)或語料的對數機率。
- 句向量:在 SentEval 基準上測試多個下游任務的表現。
這些評估不涉及實際應用,而是抽象地衡量模型對某種語言現象的捕捉能力。
詞向量評估的典型基準
詞相似度任務(Word Similarity)
給定詞對集合,人工標注者為每對詞評分相似度(通常 0–10 分)。模型需要計算詞向量的相似度(如餘弦相似度),與人工評分的相關性(通常用斯皮爾曼相關係數或皮爾森相關係數衡量)衈高越好。常見基準包括:
- RareWord(RW):353 對常用詞,訓練測試詞向量的一般能力。
- WordSim-353:常見詞對,區分相關性(relevance)和相似性(similarity)。
- SimLex-999:強調詞義相似度而非關聯性(「tiger」和「tiger」相似度 10,「tiger」和「tiger cub」關聯度高但相似度低)。
詞類比任務(Word Analogy)
給定 A–B 和 C 的類比,預測 D。例如:Paris – France = Bangkok – ? → Thailand。Google Word2Vec 發布的經典基準包含 19,544 個類比,分為語義類比(如首都–國家、性別、形容詞–副詞)和句法類比(如比較級、複數)。模型計算 vec(C) + vec(B) – vec(A) 後,找最近鄰詞(應該是 D)。
類比任務對詞向量的要求很高,因為它涉及多維的語義操作。Word2Vec 和 GloVe 在類比任務上的表現成為評估詞向量質量的重要指標。
語言模型的內在評估
困惑度(Perplexity)
對於語言模型,困惑度是最常用的內在指標。定義為: PP = exp(-1/N Σ log P(w_i)) 或 PP = (∏ P(w_i))^(-1/N)
其中 N 是測試集的詞數,P(w_i) 是模型對第 i 個詞的預測機率。困惑度可解釋為模型平均「困惑」程度:詞表中有多少個等概率的詞能達到相同的損失。困惑度越低越好。
例如,若模型在句子「貓坐在墊子上」中:
- P(貓) = 0.1(低,模型認為「貓」不太可能作為句首)
- P(坐 | 貓) = 0.2(給定「貓」,預測「坐」的機率)
- ...
困惑度大約是 5 時,表示平均而言模型「對 5 個等概率的詞一樣困惑」。
困惑度在比較同類模型(如不同大小的 LSTM)時有用,但跨模型比較需謹慎(預處理、詞表大小、訓練資料差異都影響困惑度)。
BLEU、ROUGE、METEOR(序列到序列任務)
對於機器翻譯、文摘、問答等生成任務,基於參考答案的自動評估指標:
- BLEU(Bilingual Evaluation Understudy):計算模型生成的 n-gram 與參考的 n-gram 重疊比例。
- ROUGE(Recall-Oriented Understudy for Gisting Evaluation):類似但更關注召回率,常用於文摘評估。
- METEOR:利用詞幹、同義詞、語義相似度等高階特徵改進 BLEU。
這些指標速度快、可重複,但無法完美衡量生成質量(如流暢度、創意性),往往與人工評分的相關性中等(0.3–0.6)。
內在評估與外在評估的關係
內在評估的根本問題是「與下游應用相關性弱」。一個在詞類比上表現優秀的詞向量,不一定在文本分類或情感分析上表現好。類似地,低困惑度的語言模型,在實際對話或翻譯應用中可能性能不佳。
Empirical 證據表明:
- 詞相似度與詞類比之間相關性較好(都反映靜態語義),但與下游任務的相關性參差不齊。
- 困惑度與翻譯質量、問答準確度的相關性中等(0.4–0.7)。
- BLEU 與人工評估的相關性甚至不足 0.5,尤其在新領域或低資源語言。
理由是:內在任務往往簡化或片面地反映語言現象,而真實應用往往需要綜合多個語言層面的理解。例如,詞類比強調語義向量操作,但文本分類需要的是鯉序列建模能力,靜態詞向量可能不夠。
內在評估的優點與缺點
優點:
- 快速且可重複:無需訓練下游任務的模型。
- 易於診斷:如果模型在詞相似度上失敗,表明詞向量品質有問題。
- 通用性:同一份詞向量可在多個內在任務上評估。
缺點:
- 與實際應用的相關性弱:內在優秀不保證外在優秀。
- 片面性:只衡量特定方面(如語義),忽視其他(如句法)。
- 人工標注成本:許多基準需要專家手工標注(詞相似度、類比)。
- 天花板與偏差:某些基準的 inter-rater agreement 本身就低(如詞相似度,人與人間相關性 0.7–0.8)。
現代 NLP 的評估實踐
當代 NLP 研究越來越重視外在評估(在真實下游任務上測試),因為:
- 大型語言模型(BERT、GPT)的預訓練是通用的,不針對特定內在任務。
- 研究者發現內在指標改進不一定帶來外在性能提升。
- 實際應用關心的是最終用戶體驗,而非模型內部指標。
CONLL、GLUE、SuperGLUE、SQuAD 等外在評估基準成為新興主流。不過,內在評估仍有價值:快速診斷、對比同類模型、資源受限時的務實選擇。
典型用法
開發 NLP 系統時的建議流程:
- 在內在任務上快速篩選備選模型(如從 10 個詞向量中選 3 個)。
- 在外在任務上仔細評估最終候選(在真實應用場景測試)。
- 若外在評估指標不理想,回到內在評估診斷瓶頸(詞義相似度?句法理解?)。
- 迭代改進。
常見問題
詞向量在詞類比上準確率 80%,但下游文本分類只有 70% F1,說明什麼?
說明詞向量較好地捕捉了靜態語義(詞的相似性與關係),但文本分類還需要其他信息:序列上下文、詞序、句法結構、甚至領域特定的詞義。詞向量只是特徵的一部分。改進策略包括:第一,嘗試更強大的上下文化詞向量(ELMo、BERT),它們在詞類比上不一定最優,但捕捉序列信息更強。第二,改進下游模型架構,如用 RNN 或 Transformer 代替簡單的平均池化。第三,加入額外特徵(詞性、情感詞典)。這個例子說明內在評估不能完全預測外在表現。
困惑度 5 好還是 50 好?如何比較不同模型的困惑度?
困惑度越低越好,5 遠優於 50。但困惑度的絕對值難以直觀解讀,主要用於比較。比較時需要注意:第一,相同的測試集與預處理:不同詞表大小、未知詞處理方式會改變困惑度。第二,相同的訓練資料量與質量:訓練資料多的模型通常困惑度更低。第三,模型類型相同:比較兩個 LSTM 的困惑度有意義,但比較 n-gram 模型與神經模型的困惑度容易誤導(詞表大小、平滑方式差異)。最安全的做法是在固定實驗設置下(同一份測試集、預處理、詞表)比較相對改進,而非絕對值。
BLEU 分數 25 說明翻譯質量如何?
很難直觀判斷。BLEU 是相對指標,需要參照點才有意義。業界粗略標準是:BLEU < 10 表示翻譯可讀性很低;10–20 是可讀但不夠自然;20–30 是可接受品質;30–40 是不錯;40+ 是高質量。但這些標準因語言對、域、參考數量而異。例如,中英翻譯的 BLEU 通常低於英德翻譯(語言差異);多個參考翻譯時 BLEU 分數會升高。最好的做法是與人工評估並行,或與強基線(如商用系統)比較相對改進。許多研究者現在傾向於用更新的指標(如 BERTScore、METEOR),或直接進行人工評估,因為 BLEU 與人工評分的相關性只有 0.4–0.6。