隨機欠採樣 是什麼?
Random Undersampling:隨機欠採樣 的完整解釋
處理類別不平衡資料的技術,從多數類別中隨機移除樣本,使各類別數量趨於平衡。
類別不平衡(Class Imbalance)是機器學習中常見的挑戰,在詐欺偵測、醫療診斷、故障預測等真實世界場景中尤為普遍。例如信用卡詐欺案例中,詐欺交易可能僅佔所有交易的 0.1%,若直接在這樣的資料上訓練分類模型,模型很容易學到「永遠預測正常交易」的策略,達到 99.9% 的準確率,但卻完全無法偵測真正的詐欺行為。這種現象稱為「準確率悖論(Accuracy Paradox)」。
隨機欠採樣(Random Undersampling)是解決類別不平衡問題的最直接方法之一。其做法是從多數類別(樣本數較多的類別)中隨機移除樣本,直到多數類別與少數類別的樣本比例達到設定的目標(如 1:1 或 2:1)。操作非常簡單:若正例(少數類別)有 1000 筆,負例(多數類別)有 10000 筆,則從負例中隨機選取 1000 筆保留,刪除其餘 9000 筆,最終得到平衡的 2000 筆訓練資料。
隨機欠採樣的主要優點是計算成本低、實作簡單,且可以顯著加速模型訓練(因為訓練資料量大幅減少)。對於擁有大量多數類別樣本的資料集,欠採樣能夠有效改善模型對少數類別的召回率(Recall),減少模型預測的偏差。
然而,隨機欠採樣最大的缺點是資訊損失。被隨機刪除的多數類別樣本可能包含有用的判別資訊,這些資訊在欠採樣後永久消失,可能導致模型對多數類別的整體理解不完整。特別是在多數類別內部本身存在多樣性的情況下,欠採樣可能讓模型忽略某些重要的模式,增加將正常行為誤判為異常的機率。
為了解決資訊損失問題,研究者提出了多種智慧欠採樣方法。Tomek Links 方法找出多數類別與少數類別之間「邊界」上的樣本對(彼此互為最近鄰),刪除邊界上的多數類別樣本,在清理邊界的同時保留有代表性的多數類別樣本。NearMiss 方法選擇保留那些與少數類別最近(最難區分)的多數類別樣本,讓模型更專注於學習困難樣本。Cluster Centroids 則以聚類中心取代多數類別的隨機刪除,保留各個子群體的代表性。
在實務中,隨機欠採樣常與過採樣(Oversampling)方法結合使用。例如先對少數類別進行 SMOTE(Synthetic Minority Oversampling Technique)生成合成樣本,再對多數類別進行隨機欠採樣,達到雙向調整的效果,這被稱為結合採樣(Combined Sampling)。Python 的 imbalanced-learn 套件提供了完整的欠採樣方法實作,包括 RandomUnderSampler、TomekLinks、NearMiss 等。
評估不平衡資料模型時,應使用 F1 分數、PR 曲線(Precision-Recall Curve)、AUC-ROC 等指標,而非單純的準確率(Accuracy)。在 iPAS AI 應用規劃師考試中,隨機欠採樣通常與 SMOTE、過採樣、集成學習方法(如加權損失函數)一起出現,考題常要求考生比較各方法的優缺點以及在不同場景下的適用性。 隨機欠採樣(Random Undersampling)是處理類別不平衡(Class Imbalance)問題的常見技術,通過隨機刪除多數類(Majority Class)的樣本,使訓練集中各類別的樣本數量達到平衡,從而改善分類模型對少數類的識別能力。
類別不平衡在現實應用中普遍存在:信用卡詐欺偵測中詐欺交易可能只占所有交易的 0.1%-1%;罕見疾病診斷中陽性樣本可能極稀少;工業製造中的缺陷產品往往遠少於正常產品。此時若不處理不平衡問題,模型傾向於預測所有樣本為多數類,雖然整體準確率高,但對少數類的召回率(Recall)極低。
隨機欠採樣的優勢在於簡單快速,直接減少訓練資料量可顯著加速模型訓練。實作上僅需使用 Python 的 imbalanced-learn 套件中的 RandomUnderSampler,指定目標類別比例即可。
然而,隨機欠採樣有一個明顯缺點:隨機刪除多數類樣本可能丟失有價值的資訊,特別是刪除邊界區域的樣本會模糊決策邊界。
進階欠採樣方法試圖解決資訊損失問題:Tomek Links 識別並刪除跨類別邊界的相鄰對中多數類樣本,清理決策邊界;Edited Nearest Neighbours (ENN) 刪除被多數鄰居錯誤分類的多數類樣本;NearMiss 系列算法基於與少數類的距離關係選擇保留哪些多數類樣本。
在實踐中,欠採樣常與過採樣(如 SMOTE)結合使用:先欠採樣多數類,再合成少數類樣本,在資料量和資訊保留之間取得平衡。