搜尋意圖: 如果你在找「盒鬚圖 是什麼」或「盒鬚圖 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 以五數摘要(最小值、Q1、中位數、Q3、最大值)視覺化資料分布與離群值的統計圖表。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
以五數摘要(最小值、Q1、中位數、Q3、最大值)視覺化資料分布與離群值的統計圖表。
盒鬚圖(Box Plot)是探索性資料分析(Exploratory Data Analysis,EDA)中最常使用的視覺化工具之一,能在單一圖表中同時呈現資料的集中趨勢、離散程度、分布形狀與離群值,是機器學習工作流程中資料理解階段的重要技能。
盒鬚圖的構成元素說明如下:
盒子(Box)的上下邊分別是第三四分位數(Q3,第 75 百分位數)與第一四分位數(Q1,第 25 百分位數)。盒子的高度稱為四分位距(Interquartile Range,IQR),IQR = Q3 - Q1。IQR 是衡量資料中段 50% 集中程度的指標,不受極端值影響,是比標準差更穩健的離散度量。
盒子中間的線是中位數(Median,Q2,第 50 百分位數)。中位數在盒子中的位置可以反映分布的偏態(skewness):若中位數靠近 Q1,資料右偏(正偏);若靠近 Q3,則左偏(負偏)。
鬚(Whisker)從盒子兩端延伸出去,通常延伸到資料範圍內距離四分位數 1.5 倍 IQR 的最遠資料點。即:下鬚延伸到 Q1 - 1.5×IQR 以上的最小值;上鬚延伸到 Q3 + 1.5×IQR 以下的最大值。
超出鬚範圍的資料點會以散點(dot 或 circle)單獨標示,這些點被視為離群值(outlier)。注意:這是一個統計意義上的定義,超出 1.5×IQR 的點被認為可能是離群值,但實際上是否為真正的異常需要結合業務知識判斷。
在機器學習工作流程中,盒鬚圖的典型應用場景包含以下幾個面向:
特徵分析(Feature Analysis):在訓練模型之前,對數值特徵繪製盒鬚圖,快速了解每個特徵的分布範圍、偏態程度與離群值情況。例如,若某個特徵的上鬚遠長於下鬚,表示右偏分布,可能需要對數轉換(log transformation)使分布更對稱,以改善線性模型的效能。
離群值偵測(Outlier Detection):盒鬚圖能快速視覺化哪些樣本的特徵值超出正常範圍,作為後續離群值處理(刪除、修正或保留)的參考依據。例如,信用卡消費金額的盒鬚圖可能顯示少數交易金額遠超 Q3 + 1.5×IQR,這些樣本在詐欺偵測中可能是重要信號。
模型比較(Model Comparison):在交叉驗證中,對多個模型的評估指標(如準確率、F1 分數)繪製盒鬚圖,可同時比較各模型的中位數性能與穩定性(IQR 越小表示不同 fold 間性能越穩定)。
分組比較:在含有類別特徵的資料集中,分組繪製盒鬚圖(如不同性別、不同地區的消費金額分布),能快速發現各組的分布差異,是 A/B 測試結果分析的常用工具。
與其他圖表類型的比較有助於理解盒鬚圖的適用場景。相較於直方圖(Histogram),盒鬚圖更緊湊,適合同時比較多個特徵或多個群組;直方圖則能呈現更詳細的分布形狀(如多峰分布),但難以並排比較。相較於散點圖(Scatter Plot),盒鬚圖在樣本量大時不會出現過度繪製(over-plotting)問題,但會隱藏雙峰或多峰結構(例如兩個高斯分布疊加的情況,盒鬚圖無法直接看出)。相較於小提琴圖(Violin Plot),盒鬚圖更簡潔,小提琴圖則在盒鬚圖的基礎上疊加了核密度估計(KDE),能呈現更多分布細節,但視覺較複雜。
使用盒鬚圖時常見的注意事項:樣本量過小時(如 n < 20),四分位數的估計不夠穩定,盒鬚圖的資訊量有限;遇到雙峰或多峰分布時,盒鬚圖可能呈現誤導性的「正常分布」外觀,建議搭配直方圖或核密度圖確認;離群值閾值(1.5×IQR)是統計慣例,不是絕對標準,在某些業務場景中需要調整閾值或使用領域特定的離群值定義。
在 Python 中,Matplotlib 的 plt.boxplot()、Seaborn 的 sns.boxplot() 以及 Plotly 的 px.box() 都提供了便捷的盒鬚圖繪製功能,支援分組比較、橫排顯示與互動式探索。在 iPAS AI 應用規劃師考試中,盒鬚圖是資料前置處理與 EDA 的重要考點,考生需能從盒鬚圖中判讀中位數位置、IQR 範圍與離群值分布,並說明其在特徵工程中的應用。
常見問題
盒鬚圖的鬚為什麼預設是 1.5 倍 IQR?這個值能改嗎?
1.5 倍 IQR 是由統計學家 John Tukey 提出的經驗法則,其統計直覺是:若資料服從常態分布,Q1 - 1.5×IQR 到 Q3 + 1.5×IQR 的範圍大約覆蓋 99.3% 的資料,超出此範圍的點在常態假設下出現機率約為 0.7%,可合理視為可疑離群值。這個值並非鐵律,可以根據業務需求調整:使用 3×IQR 作為「極端離群值」的閾值(Tukey 原始論文中的建議);或在異常偵測敏感度要求高的場景(如醫療或金融詐欺)中使用更小的倍數(如 1.0×IQR)。在 Python 中,seaborn 的 sns.boxplot(whis=3.0) 可調整鬚的倍數。關鍵是無論使用哪個閾值,都應結合業務知識判斷被標記的點是否真的需要特殊處理,統計閾值只是輔助工具,不能替代人工判斷。
從盒鬚圖如何判斷資料是左偏還是右偏?
判斷偏態的方式主要看兩個地方:一是中位線在盒子中的位置。如果中位線靠近盒子下方(接近 Q1),表示資料中間 50% 的值集中在較小的一側,上半部有更大的延伸空間,通常對應右偏(正偏)分布,右尾(大值方向)較長;反之中位線靠近盒子上方(接近 Q3)則對應左偏(負偏)。二是上下鬚的長度。上鬚明顯長於下鬚,表示大值方向有更長的尾部,傾向右偏;反之下鬚較長則傾向左偏。離群值的分布方向也是輔助線索:右偏分布通常在右側(大值方向)有更多離群點。收入、財富、網頁訪問量等常見的長尾分布資料通常呈現明顯右偏,在機器學習中常需要對數轉換來改善。
盒鬚圖上顯示「離群值」,是否就一定要刪除那些資料點?
絕對不是。盒鬚圖上標示為離群值的點只是統計意義上「相對於中段資料較為極端」的點,是否需要刪除取決於業務背景和數據品質判斷。有幾種常見情況:資料輸入錯誤(如年齡欄位出現 999 或日期格式錯誤導致的異常值),這種應修正或刪除;真實的業務極端值(如少數超高消費客戶、特殊設備的異常讀數),這種往往是最有價值的樣本,特別是在詐欺偵測或異常診斷中;自然的長尾分布(如收入分布),高值並非「錯誤」而是正常的分布特性。建議的做法是:先理解業務背景,再根據具體情況決定保留、修正、或獨立分析這些樣本;若要刪除,應記錄刪除的理由與數量,並確認刪除後不會引入選擇偏誤。