搜尋意圖: 如果你在找「穩健縮放 是什麼」或「穩健縮放 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 使用中位數與四分位距進行特徵縮放的預處理方法,對離群值不敏感,適合含極端值的資料集。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
使用中位數與四分位距進行特徵縮放的預處理方法,對離群值不敏感,適合含極端值的資料集。
穩健縮放(Robust Scaling)是機器學習資料預處理流程中的一種特徵縮放技術,設計動機源於傳統縮放方法(如 Min-Max 縮放和 Z-score 標準化)對離群值(outliers)高度敏感的問題。理解穩健縮放,需先認識它所解決的問題以及它背後的統計基礎。
傳統的 Min-Max 縮放將特徵值線性映射到 [0, 1] 區間,但最小值與最大值都可能是極端離群點,導致絕大多數正常值被壓縮到一個很窄的子區間內,損失了大量資訊差異。Z-score 標準化(零均值、單位方差)以平均數與標準差為基準,但平均數和標準差都是對離群值非常敏感的統計量:一個距離均值 10 個標準差的離群點會使整個特徵的平均數偏移、標準差膨脹,進而讓所有正常樣本的縮放結果都受到影響。
穩健縮放採用的統計量對離群值具有本質抵抗力:中位數(median)是排序後位於正中央的值,不受極端值大小影響;四分位距(IQR = 第 75 百分位數 - 第 25 百分位數)描述中段 50% 資料的散布程度,對極端值同樣不敏感。穩健縮放的公式為:縮放後的值 = (原始值 - 中位數) / IQR。透過這個公式,中位數對應的值縮放後為 0,第 25 百分位數縮放後為 -0.5,第 75 百分位數縮放後為 0.5,而離群值雖然不會被消除,但它們縮放後的數值也不會對其他正常樣本的縮放結果產生影響。
從統計穩健性(robustness)的角度看,穩健縮放對應的是高分解點(breakdown point)。平均數的分解點為 0,意思是只要有一個觀測值趨向無窮大,平均數就會失效;中位數的分解點為 0.5,意思是即使有接近 50% 的資料是離群值,中位數仍能正確反映資料的中心趨勢。這正是「穩健(robust)」一詞的統計含義。
在 scikit-learn 中,穩健縮放透過 RobustScaler 類別實現。預設情況下它使用第 25 到 75 百分位數(即 IQR),但使用者可以透過 quantile_range 參數調整分位數範圍,例如設為 (10, 90) 以獲得更寬的參考範圍。與其他縮放器相同,RobustScaler 遵循 fit-transform 模式:在訓練集上 fit(計算中位數與 IQR),再用相同的參數 transform 測試集,確保資料洩漏(data leakage)不會發生。
穩健縮放適用的場景主要有三類。第一是金融與經濟資料,交易量、股價波動率等指標常有極端異常值(如市場崩潰日的交易量是平日的數十倍);第二是醫療健康資料,部分生理指標(如血壓、血糖)在特定患者中可能出現極端測量值;第三是感測器資料,感測器故障或干擾可能引入短暫的極大值,穩健縮放能防止這些雜訊主導特徵尺度。相對地,若資料已確認無異常值、或離群值本身具有重要的分類意義(如詐欺偵測中的異常交易),則不一定需要穩健縮放。
在 iPAS AI 應用規劃師中級考試中,穩健縮放出現在資料預處理與特徵工程相關題目。114-2-mid-2 的兩道題目同時考查了穩健縮放與其他縮放方法的比較,考生需要能在給定資料描述(如「資料含有許多離群值」)的情境下,選出最適合的縮放策略,並說明中位數與 IQR 作為縮放基準的統計意義。了解穩健縮放與標準化(StandardScaler)、歸一化(MinMaxScaler)、最大絕對值縮放(MaxAbsScaler)的差異與適用條件,是這類題目的核心考點。 強健縮放(Robust Scaling)是一種針對含有異常值(Outliers)的資料集設計的特徵縮放方法,使用資料的中位數(Median)和四分位距(IQR, Interquartile Range)代替均值和標準差進行標準化,從而降低極端值對縮放結果的影響。
標準縮放(StandardScaler)使用均值和標準差,當資料含有異常值時,這兩個統計量會被嚴重拉偏,導致大部分「正常」資料被壓縮到很窄的範圍,而異常值依然突出。Robust Scaling 的公式為:(x - median) / IQR,其中 IQR = Q3(第75百分位)- Q1(第25百分位),這兩個統計量對異常值不敏感,因為它們基於排序統計量而非算術運算。
在實際資料中,異常值極為普遍。房價資料中偶有豪宅價格;收入資料中有少數超高收入者;感測器資料中有偶發的讀值異常。若不處理,這些異常值會嚴重影響基於歐氏距離的算法(如 K-means、KNN)和線性模型(如線性迴歸、SVM),因為這些算法的損失函數對大數值很敏感。
Robust Scaling 的局限性在於縮放後的資料範圍不固定(不像 Min-Max Scaling 必然落在 [0,1]),不適合神經網路(通常需要較固定的輸入範圍)或需要有界輸入的算法。此外,它保留了資料的相對順序,但不會將資料映射到特定範圍。
Scikit-learn 的 RobustScaler 實作提供了 quantile_range 參數,允許用戶調整用於縮放的百分位範圍(預設 25-75,可調整為更寬的 10-90 以處理更多異常值)。在管道(Pipeline)設計中,RobustScaler 應在訓練集上 fit 後,再 transform 測試集,避免資料洩露。
常見問題
穩健縮放和 Z-score 標準化應該如何選擇?
選擇縮放方法的關鍵依據是資料的分佈特性,尤其是離群值的存在與否。Z-score 標準化(StandardScaler)適合資料大致呈常態分佈且離群值較少的情況,它讓特徵具有零均值與單位方差,對後續使用高斯假設的模型(如線性迴歸、邏輯迴歸、SVM)尤其有利。穩健縮放(RobustScaler)則適合資料存在明顯離群值的情況,此時平均數與標準差已被拉偏,Z-score 標準化會使絕大多數正常樣本的縮放值落在很窄的範圍,損失特徵間的相對資訊量。判斷方式:先繪製箱型圖(box plot)觀察異常值比例;若四分位距之外存在大量極端點(超過 5% 樣本),優先考慮穩健縮放。若不確定,兩種方法都可以作為 pipeline 的一部分,透過交叉驗證比較下游模型的效能後再決定。
穩健縮放之後離群值還會存在嗎?
是的,穩健縮放並不移除或修改離群值,它只是改變特徵的縮放基準。縮放後,離群值仍然存在於縮放後的特徵空間中,只是它們的數值大小(絕對值)會相對正常樣本更大。穩健縮放的設計目標是確保中段正常資料獲得合理的縮放範圍,讓離群值不去「壓縮」正常資料的表示空間,而非消除離群值本身。如果下游任務對離群值非常敏感(如某些距離基礎的聚類演算法),縮放後仍可能需要另行處理離群值(如截斷法 winsorization、移除法或單獨標記)。若業務目標本身是偵測離群值(如詐欺偵測),則應謹慎評估穩健縮放是否會削弱離群值與正常值之間的可辨識差異。
穩健縮放在 iPAS 考試中會考哪些題型?
根據 114-2-mid-2 的出題模式,穩健縮放在 iPAS AI 應用規劃師中級考試中主要以兩類題型出現。第一類是情境選擇題:題目描述一個資料集的特性(如「包含大量離群值」「具有偏態分佈」),要求考生選出最適合的前處理方法,此時穩健縮放是對應「有離群值」情境的正確答案。第二類是概念辨別題:列出 Min-Max 縮放、Z-score 標準化、穩健縮放等方法,要求考生配對各方法使用的統計量(中位數 + IQR 對應穩健縮放,均值 + 標準差對應 Z-score,最小值 + 最大值對應 Min-Max)。考生若能記住穩健縮放使用中位數(而非均值)和 IQR(而非標準差),並理解「對離群值穩健」的統計原因,即可應對絕大多數相關考題。