最大似然估計(Maximum Likelihood Estimation)是什麼?

最大似然估計 (MLE) 是一種統計方法,用於估計機率分佈的參數,它通過最大化觀察到樣本數據的似然函數來實現。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Maximum Likelihood Estimation
主題標籤
統計方法、機器學習、模型訓練
考點定位
非 iPAS 核心術語
最後更新
2026/07/29
最大似然估計(Maximum Likelihood Estimation)是什麼? 統計方法機器學習
術語快查

搜尋意圖: 如果你在找「最大似然估計 是什麼」或「最大似然估計 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 最大似然估計 (MLE) 是一種統計方法,用於估計機率分佈的參數,它通過最大化觀察到樣本數據的似然函數來實現。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

你有沒有遇過一堆資料擺在面前,卻不知道哪個參數最合理?

你可以把最大似然估計想成,反過來問「如果這個參數是真的,現在看到的資料有多像真的會長這樣」。 它重要在於,很多統計模型、分類器和生成模型,最後都會變成在找讓資料最合理的參數。

你可以把它想成一個把抽象概念拉回日常判斷的提示,先知道它解決什麼問題,再看技術細節。

容易混淆

最大似然估計 vs 貝氏估計

最大似然估計:只看目前資料,找讓資料最可能出現的參數。 貝氏估計:把資料和先驗知識一起考慮,算出後驗分佈。 最關鍵的區別:前者不放先驗,後者會放先驗。

最大似然估計 vs 最小二乘法

最大似然估計:最大化資料出現的機率。 最小二乘法:最小化預測值和真實值的平方誤差。 最關鍵的區別:前者是機率觀點,後者是誤差觀點。

記住這句就好

找出讓「目前這批資料最像真的」那組參數。

實際案例

硬幣偏硬還是偏軟

你丟了 20 次硬幣,正面出現 15 次,最大似然估計會找出一個最能解釋這組結果的正面機率,而不是先預設它一定公平。

垃圾郵件分類

模型觀察哪些單字常出現在垃圾信裡,調整參數讓這些特徵組合下的資料機率最高,最後得到分類規則。

算法與應用

做法通常是先寫出似然函數,再把它轉成比較好算的對數似然。 最佳解不一定有漂亮封閉解,所以常搭配梯度下降或數值最佳化。 它很常和機率分佈、損失函數、模型訓練綁在一起。

最大概似估計在做什麼

最大概似估計(Maximum Likelihood Estimation, MLE)問的是:什麼樣的參數,最有可能產生我手上這批資料?

概似函數就是「在參數 θ 之下,觀察到這批資料的機率」:

L(θ) = P(資料 | θ)

MLE 就是找出讓 L(θ) 最大的那個 θ。

實作上通常改成最大化對數概似(log-likelihood),因為連乘變成連加、數值也穩定得多,而且取對數不改變最大值的位置。

實際算一次:丟一枚硬幣 10 次,出現 7 次正面,正面機率 p 是多少?

步驟 內容
概似函數 L(p) = p⁷ × (1−p)³
取對數 ln L = 7 ln p + 3 ln(1−p)
對 p 微分設為 0 7/p − 3/(1−p) = 0
解出 p = 0.7

答案就是 7/10,跟直覺一致。MLE 的價值在於它把「直覺上的答案」變成一套能套用到任何模型的通用推導方法。

MLE 跟 MAP、跟損失函數的關係

MLE 與最大後驗估計(MAP)的差別在有沒有先驗。 MAP 最大化的是 P(θ|資料),等於概似乘上先驗 P(θ)。資料很多時兩者會趨於一致,資料很少時先驗的影響很大。加上常見的高斯先驗之後,MAP 在數學上就等價於加了 L2 正則化的 MLE,這是「正則化就是加先驗」這句話的來源。

機器學習裡很多損失函數其實就是負對數概似。

假設誤差服從常態分布,最大化概似等價於最小化均方誤差(MSE)。

假設是伯努利分布或多項分布,最大化概似等價於最小化交叉熵。

這解釋了為什麼回歸預設用 MSE、分類預設用交叉熵,那不是憑感覺挑的,而是各自對應一個機率假設下的 MLE。

MLE 的兩個限制。 樣本少時容易過擬合,因為它會完全相信手上的資料。而且它給的是一個點估計,不提供不確定性,需要區間或分布時要走貝氏方法。

情境判斷

Q1(情境題): 你只有少量資料,還能用最大似然估計嗎?

→ 可以,但要小心不穩定。資料少時估計會比較抖,這時常會搭配正則化、貝氏方法或更多先驗資訊。

Q2(情境題): 如果模型很複雜,最大似然估計一定會找到唯一答案嗎?

→ 不一定。資料不足或模型太彈性時,可能出現多個局部最佳解,甚至估計不穩定。

常見問題

最大似然估計一定要假設資料分佈嗎?

要。你得先指定一個機率模型,例如常態分佈、伯努利分佈或多項式分佈,才談得上似然。

它和最大後驗估計有什麼不同?

最大後驗估計會把先驗加進來,最大似然估計只看觀測資料。兩者在沒有先驗或先驗很弱時,結果可能很接近。

為什麼常改寫成對數似然?

因為乘積太難算也容易下溢,改成對數後會把乘法變加法,計算更穩定。