等寬分箱 是什麼?
Equal-Width Binning:等寬分箱 的完整解釋
將連續型數值特徵依等距區間分割成有限個離散類別的資料前處理技術。
等寬分箱(Equal-Width Binning)是機器學習特徵工程中最基礎的資料離散化技術之一。離散化的核心動機在於:許多機器學習演算法(如樸素貝氏分類器、決策樹的某些實作、關聯規則挖掘)設計上處理離散類別特徵更為自然;此外,離散化能有效降低雜訊影響、平滑數值分佈,並使模型更容易從局部區間學習到規律,而非在每個精確數值點上過擬合。
一、運作原理與數學定義
給定一個連續型特徵 X,其觀測值的最小值為 x_min,最大值為 x_max,等寬分箱將整個取值範圍劃分為 k 個寬度相等的區間。每個區間(箱)的寬度為 w = (x_max - x_min) / k,第 i 個箱的範圍為 [x_min + (i-1)×w, x_min + i×w],其中 i 從 1 到 k。每個觀測值 x 被歸入它所落入的箱,通常以箱的編號(整數標籤 1 到 k)或箱的中點值作為新的特徵值。
以一個具體例子說明:假設年齡特徵的取值範圍為 0 到 100 歲,選擇 k = 5 個箱,則每個箱的寬度為 20 歲,五個箱分別是 [0, 20)、[20, 40)、[40, 60)、[60, 80)、[80, 100]。一個 35 歲的人將被分配到第二個箱,以標籤「2」或「20-40歲」表示。
二、等寬分箱的優勢
等寬分箱的主要優勢是簡單直觀。超參數只有箱的數量 k,不需要複雜的統計計算或資料排序;計算效率高,時間複雜度為 O(n);箱的邊界具備直觀的可解釋性,等寬的區間對業務人員和客戶易於理解與溝通。在資料分佈相對均勻的情況下,等寬分箱能提供合理的離散化結果。
三、等寬分箱的局限性
等寬分箱對資料分佈不均的情況非常敏感,這是其核心缺陷。若資料高度偏斜(例如收入分佈),大多數樣本可能落入少數幾個箱,造成箱內樣本數嚴重不均衡:有些箱可能包含 90% 的樣本,另一些箱只有寥寥幾個樣本甚至空箱,這嚴重損害了分箱的統計意義。
另一個主要問題是離群值敏感性。若資料中存在極端離群值,x_max 或 x_min 會被極端值拉伸,導致正常範圍的資料被壓縮到僅有幾個箱中,大量箱用於覆蓋離群值所在的稀疏區域。因此在使用等寬分箱前,通常需要先對離群值進行處理(截尾或移除)。
四、與等頻分箱的比較
等頻分箱(Equal-Frequency Binning,又稱分位數分箱)是另一種常見的分箱策略,其核心思想是讓每個箱包含大致相等數量的樣本,而非等寬的區間。兩者的比較如下:等寬分箱的箱寬固定,但每箱樣本數可能相差極大;等頻分箱的每箱樣本數大致相等,但箱寬可能差異極大。在資料分佈高度不均時,等頻分箱通常提供更穩健的離散化結果;但等寬分箱的區間邊界更容易向業務部門解釋。
五、實作細節與工具支援
在 Python 的 scikit-learn 中,等寬分箱透過 KBinsDiscretizer 類別實作,設定 strategy='uniform' 即可使用等寬策略。Pandas 提供的 pd.cut() 函式也支援等寬分箱,只需指定 bins 為整數,函式即自動計算等寬區間。在資料預處理管線中,分箱步驟通常放在缺失值填補之後、特徵縮放之前。
六、選擇箱數 k 的策略
箱數 k 的選擇是等寬分箱的關鍵決策。k 太小會造成過度平滑,損失細節資訊;k 太大則退化為接近原始連續值,失去離散化的意義。常見的經驗法則包括 Sturges 規則(k = 1 + log₂n)、平方根規則(k = √n)等。在機器學習場景中,k 通常作為超參數透過交叉驗證選取。
七、iPAS 考試關聯
等寬分箱在 iPAS AI 應用規劃師考試中屬於資料前處理與特徵工程的範疇,考題通常會要求考生比較等寬分箱與等頻分箱的差異,或在給定資料分佈後判斷哪種分箱策略更為合適。理解分箱技術的適用場景與限制是資料預處理知識的重要部分。