四分位距 是什麼?
IQR:四分位距 的完整解釋
四分位距(Interquartile Range, IQR)是第三四分位數(Q3)與第一四分位數(Q1)的差值,代表資料中間 50% 的分布範圍,常用於穩健的異常值偵測,不受極端值影響。
核心概念
四分位距(Interquartile Range, IQR)是描述性統計中衡量資料分散程度的穩健指標。它聚焦於資料的「中間半段」,定義為:
IQR = Q3 − Q1
其中:
- Q1(第一四分位數):25% 的資料落於此值以下
- Q3(第三四分位數):75% 的資料落於此值以下
IQR 代表了資料集中間 50% 的寬度,又稱為「中位距」或「H-spread」。
運作原理
計算步驟:
- 將資料由小到大排序
- 找到中位數(Median, Q2)
- Q1 = 下半段資料的中位數
- Q3 = 上半段資料的中位數
- IQR = Q3 − Q1
IQR 異常值偵測法則(Tukey's Fences):
統計學家 John Tukey 定義了兩組邊界:
- 內圍欄(Inner Fences):[Q1 − 1.5×IQR, Q3 + 1.5×IQR]
- 外圍欄(Outer Fences):[Q1 − 3×IQR, Q3 + 3×IQR]
落在內圍欄之外的點標記為「疑似異常值」,落在外圍欄之外的點標記為「極端異常值」。這個方法的優點是不假設資料服從特定分布。
為何 IQR 比標準差更穩健?
標準差計算依賴每個資料點,一個極端的異常值可以大幅拉高標準差,導致後續基於「均值 ± k 個標準差」的異常偵測閾值整體偏移,讓更多正常點被錯誤標記。IQR 只使用排序位置,對極端值完全不敏感。
從崩潰點(Breakdown Point)的角度看,標準差的崩潰點為 0%(即使只有一個極端值就會失效),而 IQR 的崩潰點為 25%(需要超過 25% 的資料被汙染才會使估計失效)。
實際應用
探索性資料分析(EDA)中的箱形圖
箱形圖(Box Plot)是 IQR 最直觀的視覺化工具:
- 箱體的上下邊界分別對應 Q3 和 Q1
- 箱體內的橫線為中位數 Q2
- 鬚(Whisker)延伸到內圍欄邊界
- 超出鬚的點以單獨的點標示,即異常值
資料清洗流程
在機器學習的前處理中,可以用 IQR 法自動標記並處理異常值:
import pandas as pd
def remove_outliers_iqr(df, column, factor=1.5):
Q1 = df[column].quantile(0.25)
Q3 = df[column].quantile(0.75)
IQR = Q3 - Q1
lower = Q1 - factor * IQR
upper = Q3 + factor * IQR
return df[(df[column] >= lower) & (df[column] <= upper)]
穩健標準化(Robust Scaling)
Scikit-learn 的 RobustScaler 使用 IQR 進行特徵縮放:
縮放後的值 = (x − Q2) / IQR
這種縮放方式對異常值不敏感,特別適合包含離群值的資料集,常用於信用評分、醫療數據等高雜訊場景。
監控模型飄移
在 MLOps 中,可定期計算生產環境輸入特徵的 IQR,並與訓練時的 IQR 比較。若某特徵的 IQR 出現顯著變化,可能代表資料分布發生漂移(Data Drift),需要重新訓練模型。
常見誤區
誤區一:IQR 法則是萬用的異常值偵測標準 IQR 法則基於近似正態分布的假設設計(對於常態分布,約 0.7% 的資料會被標記為異常)。對於右偏嚴重(如收入、網站流量)或雙峰分布的資料,1.5×IQR 可能過於嚴格或過於寬鬆,需要根據領域知識調整係數。
誤區二:移除所有 IQR 異常值就是好的資料清洗 異常值不一定是錯誤,它們可能是真實的極端事件(詐欺交易、稀有疾病、市場崩盤),有時恰恰是分析的核心目標。移除前應先理解異常值的業務含義。
誤區三:IQR 適用於所有類型的資料 IQR 只有在資料可排序時才有意義,適用於連續型或有序類別型資料,不適用於名目類別資料(如顏色、城市名稱)。
與相關技術的比較
| 指標 | 計算基礎 | 對異常值的穩健性 | 假設分布 | 適用場景 |
|---|---|---|---|---|
| IQR | 分位數差 | 高(崩潰點 25%) | 無 | 偏斜或含異常值資料 |
| 標準差(SD) | 均值離差 | 低(崩潰點 0%) | 常態 | 近常態分布的資料 |
| MAD(中位數絕對偏差) | 中位數離差 | 極高(崩潰點 50%) | 無 | 高汙染率資料 |
| Z-score | 均值+SD | 低 | 常態 | 快速識別偏差極大的點 |
IQR 在穩健性與計算複雜度之間取得良好平衡,是資料科學日常工作中最常用的穩健離散度指標。