標準差 是什麼?
Standard Deviation:標準差 的完整解釋
衡量資料集各數值與平均值之間平均離散程度的統計指標,反映資料的變異性。
標準差(Standard Deviation,SD 或 σ)是統計學中衡量資料集分散程度(離散性)的核心指標,也是機器學習特徵工程、模型評估、異常偵測中不可或缺的基礎概念。其物理含義是:資料集中各數值偏離平均值的「典型距離」是多少。
計算公式:母體 vs 樣本標準差 母體標準差(σ):σ = √(Σ(xᵢ - μ)² / N) 用於已知整個母體的情況(如某工廠某天生產的所有產品)。
樣本標準差(s):s = √(Σ(xᵢ - x̄)² / (n-1)) 用於從母體取樣後估計母體標準差的情況,分母用 n-1(Bessel's correction),保證估計量無偏。
兩者的區別:分母是 N(母體總數)還是 n-1(樣本數減一)。當資料量很大時差異可忽略,但在小樣本(n<30)時 Bessel's correction 非常重要,能修正系統性低估偏差。
正態分布中的三標準差法則(68-95-99.7 Rule) 當資料服從正態分布時,有非常直觀的規律:
- μ ± 1σ 的範圍內涵蓋約 68.27% 的資料點
- μ ± 2σ 的範圍內涵蓋約 95.45% 的資料點
- μ ± 3σ 的範圍內涵蓋約 99.73% 的資料點
這個法則是品質管制(SPC)中管制圖的設計基礎,也是假設檢定「95% 信賴區間」的直觀來源(μ ± 1.96σ 恰好涵蓋 95% 的資料)。
在機器學習中的核心應用
特徵標準化(Z-Score Standardization):StandardScaler 將每個特徵轉換為 z = (x - μ) / σ,使轉換後的特徵均值為 0、標準差為 1。這是 SVM、邏輯迴歸、神經網路等對特徵尺度敏感的演算法的必要前處理步驟,確保不同量綱的特徵(如身高公分 vs 體重公斤)能被均等對待。
異常偵測(Outlier Detection):超過均值 2-3 個標準差以外的樣本通常被標記為潛在異常值(Outliers)。在資料清理階段,可用 z > 2.5 或 z > 3 的閾值過濾可能的資料錯誤或感測器異常。
模型效能穩定性評估:使用 K-Fold Cross-Validation 評估模型時,報告格式為「平均 F1 ± 標準差」(如 0.872 ± 0.031),標準差反映了模型在不同資料分割下的效能穩定性。標準差越大,模型受資料分布影響越大。
批次正規化(Batch Normalization):深度學習中 BN 層的核心操作就是計算批次的均值和標準差,然後對每個特徵做標準化,使其分布穩定,加速訓練收斂並允許使用更高的學習率。
標準差 vs 方差(Variance)vs 標準誤差(Standard Error) 方差 = σ²:與標準差描述相同的分散程度,但單位是原始資料的平方。在數學推導中因可微性優先使用方差,但報告結果時標準差更易解讀。 標準誤差(SE = SD / √n):描述「樣本均值」的不確定性,而非個別數據點的分散程度。SE 越小代表樣本均值越接近真實母體均值,常用於信賴區間計算。
侷限性
對離群值高度敏感(因為離群值的偏差被平方放大);對非正態分布的描述力有限,此時改用 IQR(四分位距)更穩健;無法描述多維資料的多向分散性(需改用協方差矩陣)。
在 A/B 測試與假設檢定中的應用 標準差是計算統計顯著性的基礎。t 統計量的公式 t = (x̄₁ - x̄₂) / √(s₁²/n₁ + s₂²/n₂) 直接使用兩個樣本的標準差,標準差越小(資料越集中)或樣本量越大,同樣的均值差異就能達到更高的統計顯著性。在 A/B 測試中,若關鍵指標(如轉換率)的標準差大,需要更多樣本才能有足夠的統計檢驗力(Power),這是確定實驗所需樣本量的核心計算依據。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 標準差 | 台灣正式用語 |
| 标准差 | 簡體寫法 |
| Standard Deviation | 英文原名 |
| SD、σ(母體)、s(樣本) | 常見符號 |
| 標準偏差 | 常見變體 |
SD 這個縮寫在不同脈絡下意思不同,統計裡是標準差,但在其他領域可能指別的東西,看到縮寫要確認上下文。
公式與實際算一次
標準差是變異數的平方根,衡量資料離平均值有多散。
母體標準差 σ = √( Σ(xᵢ − μ)² / N )
樣本標準差 s = √( Σ(xᵢ − x̄)² / (n − 1) )
實際算一次。資料是 2、4、4、4、5、5、7、9,共 8 筆:
步驟 計算 結果 平均值 (2+4+4+4+5+5+7+9) ÷ 8 5 各項離差平方和 9+1+1+1+0+0+4+16 32 母體變異數 32 ÷ 8 4 母體標準差 √4 2 樣本變異數 32 ÷ 7 4.571 樣本標準差 √4.571 2.138 分母為什麼要減 1。 用樣本平均值算離差時,離差平方和天生會偏小(樣本平均值就是讓這個和最小的那個數),直接除以 n 會低估母體變異數。除以 n−1 是修正這個偏誤,這個做法叫貝索校正(Bessel's correction)。資料是全部母體就用 n,是抽樣得來的就用 n−1。多數統計軟體預設是 n−1。
怎麼讀這個數字
資料接近常態分布時有一組好記的比例:約 68% 落在平均值 ±1 個標準差內、約 95% 落在 ±2 個標準差內、約 99.7% 落在 ±3 個標準差內。這是製程管制圖與異常偵測門檻的來源。
標準差跟平均值的單位相同,所以可以直接跟資料放在一起解讀。變異數的單位是平方,不好直觀理解,這是實務上多用標準差的原因。
比較不同資料的離散程度時要用變異係數(CV = 標準差 ÷ 平均值)。標準差 10 對平均值 1000 的資料是很集中,對平均值 12 的資料則是極度分散,直接比標準差沒有意義。
對離群值極度敏感。 因為離差取了平方,一個極端值就能大幅拉高標準差。資料有厚尾或離群值時,四分位距(IQR)或中位數絕對偏差(MAD)是更穩健的選擇。