常態分佈 是什麼?
Normal Distribution:常態分佈 的完整解釋
常態分佈是一種連續機率分佈,其機率密度函數呈鐘形曲線,平均數、中位數和眾數相等,數據集中在平均值附近。
容易混淆
常態分佈 vs 均勻分佈 常態分佈:中間多、兩邊少 均勻分佈:每個區間機會差不多 最關鍵的區別:先看它是在比什麼,再看它怎麼做。
常態分佈 vs 偏態分佈 常態分佈:左右對稱 偏態分佈:一邊拖尾比較長 最關鍵的區別:先看它是在比什麼,再看它怎麼做。
記住這句就好
大多數值靠中間,少數值在兩邊。
實際案例
身高 成年人的身高常在平均值附近聚集,極端高或極端矮都少。
量測誤差 儀器每次量到的值會微微晃動,常接近常態分佈。
算法與應用
常態分佈由平均數和標準差決定形狀。 很多統計方法之所以好用,就是因為中央極限定理讓它們很常接近常態。 如果資料明顯偏斜,就不能硬當成常態。
中英對照與常見說法
| 中文 | 英文 | 備註 |
|---|---|---|
| 常態分布 | normal distribution | 台灣統計教材的標準譯法 |
| 常態分佈 | normal distribution | 同上,「佈」與「布」兩種寫法都通行 |
| 正態分布 | normal distribution | 中國大陸用語 |
| 高斯分布 | Gaussian distribution | 同一個東西,工程與機器學習文獻常用這個名字 |
| 標準常態分布 | standard normal distribution | 平均 0、標準差 1 的那一個特例 |
| 鐘形曲線 | bell curve | 口語說法,指它的形狀 |
讀論文時要注意:Gaussian 與 normal 完全同義,作者用哪一個純粹是習慣。但 Gaussian process(高斯過程)是另一個更進階的概念,不要看到 Gaussian 就當成常態分布。
為什麼常態分布到處都是
原因是中央極限定理(Central Limit Theorem):大量獨立隨機因素加總起來,總和的分布會趨近常態分布,不管每個因素本身是什麼分布。
身高受到很多基因與環境因素共同影響,量測誤差是很多微小干擾疊加的結果,所以它們都接近常態。這不是巧合,是加總這個動作造成的。
幾個關鍵性質:
完全由兩個參數決定,平均數 μ 決定中心位置,標準差 σ 決定胖瘦。 左右對稱,所以平均數、中位數、眾數三者相等。 68-95-99.7 法則:落在 μ ± 1σ 內約 68%,μ ± 2σ 約 95%,μ ± 3σ 約 99.7%。
最後這一條是實務上最常用的,Z 分數判離群值、品質管制的管制圖、信賴區間的計算,底層都是它。
但要提醒一件事:很多真實資料並不常態。收入、城市人口、網頁流量都是明顯右偏的長尾分布,硬套常態的方法會得到錯誤結論。用之前先畫直方圖或做常態性檢定。
情境判斷
Q1(直覺題):你量很多次同一個人的身高,結果大多在平均附近,這像什麼分佈? → 常態分佈。
Q2(判斷題):如果資料一邊很長尾,還能直接當常態嗎? → 不一定,得先看偏態和尾巴長度。
相關術語
常見問題
標準常態分佈是什麼?
就是平均數 0、標準差 1 的常態分佈。
它一定出現在自然界嗎?
不是,但很多獨立誤差加總後會接近它。
為什麼機器學習常看到它?
因為很多模型、評估和誤差分析都會用到。