標準差(Standard Deviation)是什麼?

衡量資料集各數值與平均值之間平均離散程度的統計指標,反映資料的變異性。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Standard Deviation
主題標籤
統計基礎、資料處理、特徵工程
考點定位
非 iPAS 核心術語
最後更新
2026/07/29
標準差(Standard Deviation)是什麼? 統計基礎資料處理
術語快查

搜尋意圖: 如果你在找「標準差 是什麼」或「標準差 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 衡量資料集各數值與平均值之間平均離散程度的統計指標,反映資料的變異性。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

衡量資料集各數值與平均值之間平均離散程度的統計指標,反映資料的變異性。

標準差(Standard Deviation,SD 或 σ)是統計學中衡量資料集分散程度(離散性)的核心指標,也是機器學習特徵工程、模型評估、異常偵測中不可或缺的基礎概念。其物理含義是:資料集中各數值偏離平均值的「典型距離」是多少。

計算公式:母體 vs 樣本標準差 母體標準差(σ):σ = √(Σ(xᵢ - μ)² / N) 用於已知整個母體的情況(如某工廠某天生產的所有產品)。

樣本標準差(s):s = √(Σ(xᵢ - x̄)² / (n-1)) 用於從母體取樣後估計母體標準差的情況,分母用 n-1(Bessel's correction),保證估計量無偏。

兩者的區別:分母是 N(母體總數)還是 n-1(樣本數減一)。當資料量很大時差異可忽略,但在小樣本(n<30)時 Bessel's correction 非常重要,能修正系統性低估偏差。

正態分布中的三標準差法則(68-95-99.7 Rule) 當資料服從正態分布時,有非常直觀的規律:

  • μ ± 1σ 的範圍內涵蓋約 68.27% 的資料點
  • μ ± 2σ 的範圍內涵蓋約 95.45% 的資料點
  • μ ± 3σ 的範圍內涵蓋約 99.73% 的資料點

這個法則是品質管制(SPC)中管制圖的設計基礎,也是假設檢定「95% 信賴區間」的直觀來源(μ ± 1.96σ 恰好涵蓋 95% 的資料)。

在機器學習中的核心應用

特徵標準化(Z-Score Standardization):StandardScaler 將每個特徵轉換為 z = (x - μ) / σ,使轉換後的特徵均值為 0、標準差為 1。這是 SVM、邏輯迴歸、神經網路等對特徵尺度敏感的演算法的必要前處理步驟,確保不同量綱的特徵(如身高公分 vs 體重公斤)能被均等對待。

異常偵測(Outlier Detection):超過均值 2-3 個標準差以外的樣本通常被標記為潛在異常值(Outliers)。在資料清理階段,可用 z > 2.5 或 z > 3 的閾值過濾可能的資料錯誤或感測器異常。

模型效能穩定性評估:使用 K-Fold Cross-Validation 評估模型時,報告格式為「平均 F1 ± 標準差」(如 0.872 ± 0.031),標準差反映了模型在不同資料分割下的效能穩定性。標準差越大,模型受資料分布影響越大。

批次正規化(Batch Normalization):深度學習中 BN 層的核心操作就是計算批次的均值和標準差,然後對每個特徵做標準化,使其分布穩定,加速訓練收斂並允許使用更高的學習率。

標準差 vs 方差(Variance)vs 標準誤差(Standard Error) 方差 = σ²:與標準差描述相同的分散程度,但單位是原始資料的平方。在數學推導中因可微性優先使用方差,但報告結果時標準差更易解讀。 標準誤差(SE = SD / √n):描述「樣本均值」的不確定性,而非個別數據點的分散程度。SE 越小代表樣本均值越接近真實母體均值,常用於信賴區間計算。

侷限性

對離群值高度敏感(因為離群值的偏差被平方放大);對非正態分布的描述力有限,此時改用 IQR(四分位距)更穩健;無法描述多維資料的多向分散性(需改用協方差矩陣)。

在 A/B 測試與假設檢定中的應用 標準差是計算統計顯著性的基礎。t 統計量的公式 t = (x̄₁ - x̄₂) / √(s₁²/n₁ + s₂²/n₂) 直接使用兩個樣本的標準差,標準差越小(資料越集中)或樣本量越大,同樣的均值差異就能達到更高的統計顯著性。在 A/B 測試中,若關鍵指標(如轉換率)的標準差大,需要更多樣本才能有足夠的統計檢驗力(Power),這是確定實驗所需樣本量的核心計算依據。

中英對照與常見說法

說法 出現場合
標準差 台灣正式用語
标准差 簡體寫法
Standard Deviation 英文原名
SD、σ(母體)、s(樣本) 常見符號
標準偏差 常見變體

SD 這個縮寫在不同脈絡下意思不同,統計裡是標準差,但在其他領域可能指別的東西,看到縮寫要確認上下文。

公式與實際算一次

標準差是變異數的平方根,衡量資料離平均值有多散。

母體標準差 σ = √( Σ(xᵢ − μ)² / N )

樣本標準差 s = √( Σ(xᵢ − x̄)² / (n − 1) )

實際算一次。資料是 2、4、4、4、5、5、7、9,共 8 筆:

步驟 計算 結果
平均值 (2+4+4+4+5+5+7+9) ÷ 8 5
各項離差平方和 9+1+1+1+0+0+4+16 32
母體變異數 32 ÷ 8 4
母體標準差 √4 2
樣本變異數 32 ÷ 7 4.571
樣本標準差 √4.571 2.138

分母為什麼要減 1。 用樣本平均值算離差時,離差平方和天生會偏小(樣本平均值就是讓這個和最小的那個數),直接除以 n 會低估母體變異數。除以 n−1 是修正這個偏誤,這個做法叫貝索校正(Bessel's correction)。資料是全部母體就用 n,是抽樣得來的就用 n−1。多數統計軟體預設是 n−1。

怎麼讀這個數字

資料接近常態分布時有一組好記的比例:約 68% 落在平均值 ±1 個標準差內、約 95% 落在 ±2 個標準差內、約 99.7% 落在 ±3 個標準差內。這是製程管制圖與異常偵測門檻的來源。

標準差跟平均值的單位相同,所以可以直接跟資料放在一起解讀。變異數的單位是平方,不好直觀理解,這是實務上多用標準差的原因。

比較不同資料的離散程度時要用變異係數(CV = 標準差 ÷ 平均值)。標準差 10 對平均值 1000 的資料是很集中,對平均值 12 的資料則是極度分散,直接比標準差沒有意義。

對離群值極度敏感。 因為離差取了平方,一個極端值就能大幅拉高標準差。資料有厚尾或離群值時,四分位距(IQR)或中位數絕對偏差(MAD)是更穩健的選擇。

常見問題

樣本標準差為何除以 n-1 而不是 n?這個差別在實務上重要嗎?

這是 Bessel's correction(貝塞爾修正),理由如下:從樣本估計母體標準差時,樣本均值 x̄ 本身也是估計量,它天然地「靠近」樣本內的資料點(因為 x̄ 是使所有點到均值距離平方和最小的值),導致以 n 為分母計算的標準差系統性地低估母體標準差。除以 n-1 可修正這個偏差,讓樣本標準差成為母體標準差的無偏估計量(無偏意味著若重複多次取樣,期望值等於真實母體標準差)。在實務重要性上:當 n ≥ 50 時,n 和 n-1 的差異通常在 1-2% 以內,影響可忽略;但在 n=5 的小樣本中,分母差異是 16.7%,對估計結果有顯著影響,此時 Bessel's correction 至關重要。

標準差和標準誤差(Standard Error)的用途有何不同?什麼時候用哪個?

兩者描述的是截然不同的不確定性。標準差(SD)描述資料集中個別觀測值的分散程度,是資料本身的屬性,與樣本量 n 無關(增加樣本量不會讓資料本身變得更集中)。標準誤差(SE = SD / √n)描述的是樣本均值的精度,是估計量的屬性,樣本量越大 SE 越小(均值越可靠)。使用原則:要描述研究對象(如某群人的身高有多分散)→ 用 SD;要描述研究結論的精度(如這批人的平均身高估計有多準)→ 用 SE。報告信賴區間(CI)時用 SE(CI ≈ 均值 ± 1.96×SE);報告資料的變異性時用 SD。

在特徵工程時,什麼情況下不應該用 StandardScaler(基於標準差的標準化)?

有四種主要情況應考慮替代方案:1)特徵有大量離群值時,StandardScaler 的均值和標準差都會受到拉偏,正常資料的標準化結果也因此失真,改用 RobustScaler(基於中位數和 IQR,對離群值不敏感);2)特徵分布高度偏態(非正態)時,先做 Log 轉換或 Box-Cox 轉換使分布更對稱,再做標準化效果更好;3)特徵有明確物理邊界(如圖像像素 0-255,用 MinMaxScaler 歸一到 0-1 更合理);4)樹狀模型(決策樹、隨機森林、XGBoost、LightGBM)完全不受特徵尺度影響,因為它們的分裂是基於閾值比較而非距離,標準化對這類模型沒有幫助,反而增加不必要的前處理步驟。