搜尋意圖: 如果你在找「隨機欠採樣 是什麼」或「隨機欠採樣 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 處理類別不平衡資料的技術,從多數類別中隨機移除樣本,使各類別數量趨於平衡。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
處理類別不平衡資料的技術,從多數類別中隨機移除樣本,使各類別數量趨於平衡。
類別不平衡(Class Imbalance)是機器學習中常見的挑戰,在詐欺偵測、醫療診斷、故障預測等真實世界場景中尤為普遍。例如信用卡詐欺案例中,詐欺交易可能僅佔所有交易的 0.1%,若直接在這樣的資料上訓練分類模型,模型很容易學到「永遠預測正常交易」的策略,達到 99.9% 的準確率,但卻完全無法偵測真正的詐欺行為。這種現象稱為「準確率悖論(Accuracy Paradox)」。
隨機欠採樣(Random Undersampling)是解決類別不平衡問題的最直接方法之一。其做法是從多數類別(樣本數較多的類別)中隨機移除樣本,直到多數類別與少數類別的樣本比例達到設定的目標(如 1:1 或 2:1)。操作非常簡單:若正例(少數類別)有 1000 筆,負例(多數類別)有 10000 筆,則從負例中隨機選取 1000 筆保留,刪除其餘 9000 筆,最終得到平衡的 2000 筆訓練資料。
隨機欠採樣的主要優點是計算成本低、實作簡單,且可以顯著加速模型訓練(因為訓練資料量大幅減少)。對於擁有大量多數類別樣本的資料集,欠採樣能夠有效改善模型對少數類別的召回率(Recall),減少模型預測的偏差。
然而,隨機欠採樣最大的缺點是資訊損失。被隨機刪除的多數類別樣本可能包含有用的判別資訊,這些資訊在欠採樣後永久消失,可能導致模型對多數類別的整體理解不完整。特別是在多數類別內部本身存在多樣性的情況下,欠採樣可能讓模型忽略某些重要的模式,增加將正常行為誤判為異常的機率。
為了解決資訊損失問題,研究者提出了多種智慧欠採樣方法。Tomek Links 方法找出多數類別與少數類別之間「邊界」上的樣本對(彼此互為最近鄰),刪除邊界上的多數類別樣本,在清理邊界的同時保留有代表性的多數類別樣本。NearMiss 方法選擇保留那些與少數類別最近(最難區分)的多數類別樣本,讓模型更專注於學習困難樣本。Cluster Centroids 則以聚類中心取代多數類別的隨機刪除,保留各個子群體的代表性。
在實務中,隨機欠採樣常與過採樣(Oversampling)方法結合使用。例如先對少數類別進行 SMOTE(Synthetic Minority Oversampling Technique)生成合成樣本,再對多數類別進行隨機欠採樣,達到雙向調整的效果,這被稱為結合採樣(Combined Sampling)。Python 的 imbalanced-learn 套件提供了完整的欠採樣方法實作,包括 RandomUnderSampler、TomekLinks、NearMiss 等。
評估不平衡資料模型時,應使用 F1 分數、PR 曲線(Precision-Recall Curve)、AUC-ROC 等指標,而非單純的準確率(Accuracy)。在 iPAS AI 應用規劃師考試中,隨機欠採樣通常與 SMOTE、過採樣、集成學習方法(如加權損失函數)一起出現,考題常要求考生比較各方法的優缺點以及在不同場景下的適用性。 隨機欠採樣(Random Undersampling)是處理類別不平衡(Class Imbalance)問題的常見技術,通過隨機刪除多數類(Majority Class)的樣本,使訓練集中各類別的樣本數量達到平衡,從而改善分類模型對少數類的識別能力。
類別不平衡在現實應用中普遍存在:信用卡詐欺偵測中詐欺交易可能只占所有交易的 0.1%-1%;罕見疾病診斷中陽性樣本可能極稀少;工業製造中的缺陷產品往往遠少於正常產品。此時若不處理不平衡問題,模型傾向於預測所有樣本為多數類,雖然整體準確率高,但對少數類的召回率(Recall)極低。
隨機欠採樣的優勢在於簡單快速,直接減少訓練資料量可顯著加速模型訓練。實作上僅需使用 Python 的 imbalanced-learn 套件中的 RandomUnderSampler,指定目標類別比例即可。
然而,隨機欠採樣有一個明顯缺點:隨機刪除多數類樣本可能丟失有價值的資訊,特別是刪除邊界區域的樣本會模糊決策邊界。
進階欠採樣方法試圖解決資訊損失問題:Tomek Links 識別並刪除跨類別邊界的相鄰對中多數類樣本,清理決策邊界;Edited Nearest Neighbours (ENN) 刪除被多數鄰居錯誤分類的多數類樣本;NearMiss 系列算法基於與少數類的距離關係選擇保留哪些多數類樣本。
在實踐中,欠採樣常與過採樣(如 SMOTE)結合使用:先欠採樣多數類,再合成少數類樣本,在資料量和資訊保留之間取得平衡。
常見問題
隨機欠採樣和 SMOTE 過採樣哪個更好?
兩者各有適用場景,沒有絕對優劣。隨機欠採樣的優點是速度快、簡單,適合多數類別樣本數量極大(百萬級別以上)的場景,可以顯著加速訓練。缺點是會丟失多數類別的資訊。SMOTE 過採樣則透過對少數類別進行插值合成新樣本,不刪除任何原始資料,保留了所有資訊,但會增加訓練集大小,計算成本更高,且合成樣本可能在高維空間中引入雜訊。實務上,結合兩者的效果通常優於單獨使用,例如先用 SMOTE 增加少數類別樣本,再用隨機欠採樣減少多數類別,達到雙向平衡。
欠採樣後,資料集應該達到什麼樣的比例才算合理?
常見目標是讓正負例比例達到 1:1 或 1:2,但「最佳比例」並非固定值,需要透過交叉驗證實驗確定。完全平衡(1:1)不一定是最優選擇,因為真實世界中的測試資料通常仍保持原始的不平衡比例。有研究指出,輕度欠採樣(如從原始的 1:100 調整到 1:10 或 1:20)有時比完全平衡更有效,因為保留了部分多數類別的代表性。建議在不同採樣比例下訓練模型,以 F1 分數或 AUC-PR 等指標評估,找出最適合當前業務場景的比例。
欠採樣後評估模型時應該注意什麼?
欠採樣後的評估有幾個重要注意事項。第一,驗證集與測試集不應進行欠採樣,只有訓練集才需要調整,確保評估時反映真實資料分佈。第二,不要用準確率(Accuracy)作為主要指標,因為在類別不平衡的測試集上,準確率會被多數類別主導。應改用 F1 分數、召回率(針對少數類別)、Precision-Recall AUC 或 ROC AUC。第三,建議多次隨機欠採樣並取平均結果,因為每次隨機刪除的樣本不同,可能導致結果波動。使用整合欠採樣(Ensemble Undersampling)讓多個欠採樣子集各自訓練模型再集成,能更穩定地利用所有多數類別資料。