精確率-召回率曲線(Precision-Recall Curve)是什麼?

二分類評估工具,縱軸為精確率,橫軸為召回率,展示模型在不同決策閾值下精確率和召回率的權衡關係,特別適合評估類別不均衡問題|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Precision-Recall Curve
主題標籤
模型評估、機器學習、分類問題
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
精確率-召回率曲線(Precision-Recall Curve)是什麼? 模型評估機器學習
術語快查

搜尋意圖: 如果你在找「精確率-召回率曲線 是什麼」或「精確率-召回率曲線 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 二分類評估工具,縱軸為精確率,橫軸為召回率,展示模型在不同決策閾值下精確率和召回率的權衡關係,特別適合評估類別不均衡問題

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

二分類評估工具,縱軸為精確率,橫軸為召回率,展示模型在不同決策閾值下精確率和召回率的權衡關係,特別適合評估類別不均衡問題

核心概念

PR 曲線是二分類模型評估最直觀、最實用的工具之一。與準確度、AUC 等全局指標不同,PR 曲線讓從業者清楚看到「如果我提高標準,精確率會怎樣變化;如果我降低標準,召回率會怎樣變化」。

PR 曲線的優勢特別體現在類別不均衡場景。例如,欺詐檢測中正常交易佔 99.9%,ROC 曲線可能在假正例率軸上發生「膨脹」,視覺上顯得模型很好,但 PR 曲線會準確反映在低假正例率時的精確率和召回率實況,更誠實地展示模型質量。

PR 曲線的每一個點代表模型在特定閾值下的性能。點越靠右上角,性能越好(既高精確率又高召回率)。

運作原理

曲線繪製過程

  1. 遍歷閾值:從高到低遍歷所有可能的決策閾值(如 0.99, 0.95, ..., 0.05, 0.01)。

  2. 計算指標:對於每個閾值,計算對應的精確率和召回率:

    • Precision = TP / (TP + FP)
    • Recall = TP / (TP + FN) 其中 TP 是真正例、FP 是假正例、FN 是假負例。
  3. 繪製點:以(Recall, Precision)為座標繪製點,連接成曲線。

曲線的形狀特徵

理想模型的 PR 曲線會達到(1, 1):完美精確率和完美召回率。隨著閾值降低,召回率逐漸增加(發現更多正例),但精確率逐漸下降(誤報增加)。曲線通常呈「左上到右下」的下降趨勢。

曲線越靠近左上角越好。完美模型是一條從(0, 1)上升到(1, 1)再水平到右上角的曲線。實際模型的曲線會在這個理想之下。

曲線下面積(AP)

Average Precision(AP)是 PR 曲線下的面積,衡量模型的整體性能。計算方法包括:

簡單梯形積分

AP = Σ (Δ Recall * Precision)

遍歷所有閾值,計算相鄰兩點之間的面積(梯形),求和。

  • 插值計算(更精確): 對於每個召回率水平,取對應的最大精確率,計算積分。這樣避免了精確率波動對面積的影響。

AP 的範圍是 0 到 1。AP > 0.8 表示很好,AP > 0.9 表示優秀,AP < 0.5 表示較差。

與 ROC 曲線的對比

ROC 曲線以假正例率(FPR)為橫軸,真正例率(TPR)為縱軸。 PR 曲線以召回率(TPR)為橫軸,精確率為縱軸。

在類別均衡時,ROC 和 PR 曲線傳達相似信息。在類別不均衡時,PR 曲線更敏感。例如,99:1 的不均衡下,FPR 軸會高度壓縮(FP 最多 1%),ROC 曲線看起來很好。而 PR 曲線直接展示精確率(在低閾值時會明顯下降),更誠實。

實際應用

  • 欺詐檢測:用 PR 曲線評估欺詐檢測模型。曲線上的每個點代表不同的審核嚴格程度。選擇精確率 95% 對應的點,讀出對應的召回率(如 60%)和閾值,部署後自動審核 60% 的欺詐,其餘 40% 留作人工複查。

  • 醫療診斷:用 PR 曲線評估疾病診斷模型。選擇召回率 99% 對應的點(不漏掉患者),讀出對應的精確率和閾值。如精確率是 80%,意味著診斷為患病的患者中 80% 真的患病,20% 是誤診。

  • 搜尋引擎排名:用 PR 曲線評估文檔相關性排名模型。縱軸精確率代表排名結果的相關性,橫軸召回率代表找回相關文檔的完整性。

  • 推薦系統:用 PR 曲線評估推薦模型。精確率代表推薦的準確性(推薦的物品中用戶實際喜歡的比例),召回率代表推薦的完整性(用戶喜歡的物品中被推薦的比例)。

  • 垃圾郵件檢測:用 PR 曲線評估垃圾郵件過濾模型。選擇精確率 99% 的點(確保過濾的郵件確實是垃圾),對應的召回率可能只有 70%(30% 垃圾郵件被漏掉)。這個權衡可以接受(寧可收到垃圾也不要誤殺正常郵件)。

常見誤區

  • 誤區 1:PR 曲線和 ROC 曲線在所有情況下傳達相同信息。在類別均衡時相似,但在嚴重不均衡時,PR 曲線更敏感。不應該只看 ROC,應該同時參考 PR。

  • 誤區 2:曲線下面積(AP)大等於模型在實際應用中性能好。AP 是平均性能,但實際應用可能只關心曲線的特定部分(如精確率 > 90%)。應該在曲線上找到符合業務約束的點。

  • 誤區 3:PR 曲線越靠近(1, 1)越好。實際上,曲線的位置反映模型質量,與達到的點無關。即使曲線無法達到(1, 1),只要在相同條件下比其他模型靠上,就更優。

  • 誤區 4:可以直接比較不同資料集上的 AP 值。AP 依賴正負例的分布。資料集的不均衡度不同,AP 值無法直接比較。應該只在同一資料集上比較不同模型的 AP。

與相關技術的比較

  • PR 曲線 vs. ROC 曲線:兩者都是評估二分類模型的工具,展示不同閾值下的性能。ROC 用真正例率和假正例率,PR 用精確率和召回率。PR 曲線在類別不均衡下更敏感,ROC 在類別均衡時更直觀。許多應用同時報告兩者。

  • PR 曲線 vs. F1-score:F1-score 是精確率和召回率的調和均值,單一數值。PR 曲線展示整個權衡過程,更豐富。F1 假設精確率和召回率同等重要,PR 曲線讓從業者根據業務選擇。

  • PR 曲線 vs. 混淆矩陣:混淆矩陣展示特定閾值下的分類結果(TP、FP、FN、TN)。PR 曲線展示不同閾值下的性能演變。混淆矩陣是點,PR 曲線是線。

  • PR 曲線 vs. 閾值曲線:閾值曲線展示精確率、召回率、F1 等指標隨閾值的變化。PR 曲線只展示精確率和召回率的關係,不顯示閾值軸。兩者互補。

常見問題

在類別高度不均衡的場景中,為什麼 PR 曲線比 ROC 更好?

類別高度不均衡(如正例 0.1%,負例 99.9%)時,ROC 曲線的假正例率軸會極度壓縮。假正例率 = FP / (FP + TN),分母(TN + FP)中 TN 通常非常大(負例多),所以即使 FP 增加,FPR 變化也很小。這導致 ROC 曲線在 FPR 軸的低端集中,視覺上顯得模型性能很好(曲線大幅上升),實際上精確率可能很低。PR 曲線的精確率 = TP / (TP + FP) 對不均衡敏感,隨著假正例增加,精確率明顯下降。PR 曲線更誠實地反映「你找到的正例中有多少是真的」,在不均衡場景至關重要。欺詐、疾病診斷等罕見事件檢測必須用 PR 曲線。

如何基於 PR 曲線選擇最優決策閾值?

選擇取決於業務目標。(1)如果目標是最大化 F1-score,在曲線上找精確率 = 召回率的點(F1 最高)。(2)如果有精確率或召回率的硬性要求,在曲線上找滿足該約束的點。例如,要求精確率 >= 90%,找曲線上精確率為 90% 的點,讀出對應的召回率和閾值。(3)如果有成本信息,計算不同點的成本,選擇成本最低的點。(4)如果沒有具體要求,可以選曲線的「膝點」(knee point),即精確率下降和召回率上升速率平衡的位置。實務中,應該多選幾個候選點,與業務負責人討論權衡,最終確定。

AP(曲線下面積)高的模型一定比 AP 低的模型在實際應用中更好嗎?

不一定。AP 是全局平均性能,但實際應用可能只關心曲線的特定部分。例如,模型 A 的 AP = 0.85,模型 B 的 AP = 0.80,但在精確率 > 95% 的區間(可能是業務的硬性要求),模型 B 的召回率更高。在那個約束下,模型 B 更優。AP 用於快速比較整體性能,但具體選型時應該在曲線上找到符合業務約束的點,比較約束下的性能。此外,AP 依賴資料集分布,不同資料集的 AP 無法直接比較。應該只在同一資料集和相同業務約束下比較模型。