中央極限定理 是什麼?
Central Limit Theorem:中央極限定理 的完整解釋
中央極限定理指出,大量獨立隨機變數的總和(或平均值)趨近於常態分佈,與原始變數的分佈無關。是統計推論的基石。
容易混淆
中央極限定理 vs 大數法則 大數法則說平均會靠近真值,中央極限定理說平均值的分布會趨近常態。
中央極限定理 vs 母體分布 母體可以很歪,但樣本平均在樣本夠多時會變得像常態。
中央極限定理 vs 正態分布 常態分布是結果型態,中央極限定理是為什麼會出現這個型態。
記住這句就好
先看它要解決的是什麼問題,再看它是不是最合適的方法。
實際案例
案例 1:A/B 測試 很多線上實驗都靠它來理解樣本平均的波動。
案例 2:製造抽樣 只抽一小批商品,也能推估整批平均是否偏掉。
算法與應用
面向 重點 核心 獨立同分布的樣本平均在樣本數變大時會趨近常態。 用途 是信賴區間、檢定和很多統計推論的底層理由。 注意 獨立性和樣本數太小都會讓近似變差。
中央極限定理與大數法則不是同一件事
| 項目 | 大數法則(LLN) | 中央極限定理(CLT) |
|---|---|---|
| 講什麼 | 樣本平均會收斂到母體平均 | 樣本平均的分布會趨近常態分布 |
| 回答的問題 | 抽夠多會不會準 | 誤差有多大、長什麼形狀 |
| 給你的東西 | 一個點 | 一整個分布 |
兩者常被混用,但分工很清楚。大數法則告訴你「多抽一點就會接近真值」,中央極限定理告訴你「還差多少,而且差距的分布是什麼形狀」。
沒有大數法則,你不知道抽樣有沒有意義;沒有中央極限定理,你算不出信賴區間,也做不了假設檢定。
定理的內容與那個關鍵的根號 n
從平均數 μ、標準差 σ 的母體中抽出 n 個獨立樣本,樣本平均 X̄ 的分布會滿足:
平均數等於 μ 標準差等於
σ / √n,這個值叫標準誤(standard error) n 夠大時,形狀趨近常態分布最關鍵的是分母那個根號 n。它意味著:精度的提升跟樣本數的平方根成正比,不是跟樣本數成正比。
要把誤差減半,樣本數必須變成四倍。要減到十分之一,樣本數要一百倍。這條規律解釋了為什麼民調通常抽一千多份就停,因為從 1,000 加到 4,000 只換來誤差減半,成本卻是四倍。
適用的前提與常見誤解
前提:樣本要獨立且同分布,母體變異數要有限。 少數重尾分布(例如柯西分布)變異數不存在,CLT 不適用。
「n 大於 30 就可以」只是經驗法則,不是定理的一部分。 母體本身接近常態時,n 等於 5 可能就夠;母體極度偏態時,n 等於 100 都不見得夠。
最常見的誤解:以為 CLT 說「資料本身會變常態」。 它說的是「樣本平均的分布會趨近常態」,資料本身的分布完全不會改變。收入分布永遠是右偏的,但你每次抽 500 人算出來的平均收入,那一串平均值會呈常態。
情境判斷
Q1(判斷題): 母體分布很偏,樣本平均就一定不能用常態近似嗎? → 不一定,樣本夠大時通常還是可以。
Q2(判斷題): 如果樣本彼此不獨立,中央極限定理還能直接套嗎? → 要小心,依賴性太強時近似會失真。
相關術語
常見問題
中央極限定理有多重要?
它讓很多抽樣推論有了常態近似的基礎。
樣本數要多大才夠?
沒有硬答案,要看分布形狀和依賴程度。
它和常態分布一樣嗎?
不一樣,常態分布是分布本身,中央極限定理是樣本平均的趨勢。