負二項分布 是什麼?

Negative Binomial Distribution:負二項分布 的完整解釋

描述在一連串獨立伯努利試驗中,達到指定成功次數之前所需失敗次數的機率分布。

負二項分布(Negative Binomial Distribution,NB 分布)是統計學與機率論中一個重要的離散機率分布,在 AI 與機器學習領域中主要出現在計數資料建模、貝葉斯推斷與自然語言處理的統計語言模型中。理解負二項分布有助於選擇適合的統計模型,避免因資料特性與模型假設不符而造成推論偏誤。

基本定義與參數

負二項分布有兩種等價的定義方式:

定義一(失敗次數版本):在每次試驗中,成功機率為 p(0 < p < 1),問取得第 r 次成功之前恰好失敗 k 次的機率。此時隨機變數 X = k(失敗次數)服從 NB(r, p),機率質量函數為 P(X=k) = C(k+r-1, k) × p^r × (1-p)^k,其中 C(k+r-1, k) 是組合數。

定義二(試驗總次數版本):問取得第 r 次成功時,總共需要進行幾次試驗(Y = k + r)。兩種定義本質相同,只是計數對象不同,使用時需注意文獻採用哪個版本。

統計特性:期望值 E[X] = r(1-p)/p,變異數 Var[X] = r(1-p)/p²。顯而易見,變異數大於期望值(因為除以 p < 1 讓分母縮小),這正是它能處理過度離散的數學基礎。

過度離散(Overdispersion)

卜瓦松分布(Poisson Distribution)常被用來模擬計數資料,但它有一個強假設:期望值等於變異數(λ = μ = σ²)。然而現實資料中,計數資料的變異數往往大於期望值,稱為「過度離散」(Overdispersion)。負二項分布可視為卜瓦松分布的泛化版本:若假設每個觀測單位的卜瓦松參數 λ 不固定,而是服從 Gamma 分布,則邊際分布(marginalized distribution)就是負二項分布。因此負二項分布天然地適合建模存在個體異質性(individual heterogeneity)的計數資料。

與卜瓦松分布的比較

特徵:卜瓦松要求期望值等於變異數,負二項允許變異數大於期望值;卜瓦松只有一個參數(λ),負二項有兩個參數(r 和 p,或等價的 μ 和 α),靈活性更高;在計數小且分散時卜瓦松通常已足夠,但若資料呈現過度離散,負二項通常提供更好的配適。實際決策時,可先做卜瓦松回歸殘差診斷或執行過度離散檢定(如 Cameron-Trivedi 檢定),若顯著過度離散則改用負二項回歸。

應用場景

生態學與生物統計:計算某區域中某物種個體數量,因個體傾向聚集分布(clustering),過度離散很常見,負二項分布是標準的計數模型選擇。

醫學臨床試驗:計算藥物試驗中患者的急性發作次數(如哮喘發作、癲癇發作),個體差異導致過度離散,負二項回歸是常見的統計模型。

自然語言處理(NLP):詞頻統計中,單詞在文件中出現次數呈現明顯的過度離散(少數詞極高頻,多數詞低頻),負二項分布常被用來建模詞袋模型中的詞頻分布,是統計語言模型的理論基礎之一。

網頁分析與商業智慧:計算用戶在一段時間內的購買次數、點擊次數、客服聯繫次數,這些計數資料通常過度離散,適合用負二項模型。

社交媒體與病毒傳播:貼文分享次數、疾病傳播中的二代病例數(各個感染者的傳播數差異很大),負二項分布能捕捉超級傳播者(super-spreader)造成的高變異性。

貝葉斯推斷中的共軛先驗

在貝葉斯統計中,若似然函數為負二項分布,則成功機率 p 的共軛先驗(Conjugate Prior)是 Beta 分布。這讓後驗分布(Posterior)仍為 Beta 分布,大幅簡化貝葉斯更新的計算,是貝葉斯計數模型的重要性質。

負二項分布的極限情況

當 r 趨近於無窮大而 p 趨近於 1(且 r(1-p) → λ 為常數)時,負二項分布收斂至卜瓦松分布(Poisson Distribution)。這個性質在理論上說明了兩者的關係,也提供了一種判斷是否需要用負二項分布替換卜瓦松分布的直觀依據:若資料顯示過度離散,應優先考慮負二項;若離散程度與期望值相近,卜瓦松已足夠。

在 iPAS AI 應用規劃師認證中,負二項分布屬於統計與機率基礎的考核範疇,考生需理解其定義、與卜瓦松分布的比較,以及在計數資料建模中的適用場景。

常見問題