---
title: "拉普拉斯平滑（Laplace Smoothing）"
slug: laplace-smoothing
language: zh-TW
source: https://aiterms.tw/terms/laplace-smoothing
updated_at: 2026-06-22
tags: [統計方法, 機器學習, 自然語言處理, 模型訓練]
ipas_term: false
---

# 拉普拉斯平滑（Laplace Smoothing）

拉普拉斯平滑（Laplace Smoothing）又稱加一平滑，是貝氏統計中避免零機率問題的技術，在計算類別條件機率時，將每個類別的計數加上常數 α（通常為 1），防止訓練集未見過的詞彙或特徵使整個機

## 完整說明

拉普拉斯平滑（Laplace Smoothing），又稱加法平滑（Additive Smoothing），是樸素貝氏分類器（Naive Bayes Classifier）中解決「零頻問題」的標準技術。當訓練集中某個特徵值從未與某個類別共同出現時，條件機率估計為 0，導致後驗機率計算中整個乘積歸零，即使其他特徵都強烈指向該類別也無法挽救。拉普拉斯平滑透過在每個類別的計數上加上平滑參數 α，確保所有條件機率估計均為正值，避免任何合法特徵值導致機率歸零。

## 常見問題

### 拉普拉斯平滑的 α 參數有什麼意義？應該怎麼選？

α 是平滑強度，貝葉斯解讀為「每個特徵類別組合的先驗假想觀測次數」。α = 1 意味著在計算前，假設每個特徵值與每個類別各有一次共現，是最常見的預設。較小的 α（如 0.1）平滑效果弱，更尊重實際觀測；較大的 α 使估計更趨向均等分布，提供更強的正則化。選擇 α 應透過交叉驗證，Scikit-learn 的 MultinomialNB 中 alpha 參數可以用 GridSearchCV 調整。訓練資料豐富時傾向較小的 α，稀疏場景（詞彙表大、訓練集小）傾向較大的 α。

### 拉普拉斯平滑和 L2 正則化有什麼相似之處？

兩者都是防止模型對訓練資料過度擬合的正則化手段，但作用機制不同。拉普拉斯平滑在貝氏框架下等價於給機率加上 Dirichlet 均勻先驗，防止任何特徵的條件機率估計為 0；L2 正則化（Ridge）在損失函數中加入參數的平方懲罰項，防止任何線性模型參數過大。兩者都是「縮向預設值」的策略：拉普拉斯平滑把機率縮向均等分布，L2 把參數縮向零。在邏輯斯迴歸中，C 參數（L2 強度的倒數）與樸素貝氏的 α 在概念上扮演類似的角色。

### 現代深度學習模型還需要拉普拉斯平滑嗎？

現代深度學習語言模型（如 Transformer、GPT 等）透過稠密詞嵌入（Dense Word Embeddings）處理詞彙表的稀疏性，神經網路的參數化方式使其天然能處理未見過的詞彙組合，不存在傳統 N-gram 模型的零頻問題，因此不需要拉普拉斯平滑。然而，在以下場景中拉普拉斯平滑仍有實際價值：使用多項式樸素貝氏做文字分類（快速基線）、傳統統計 N-gram 語言模型、以及任何基於頻率計數的離散機率估計任務。

---

來源：https://aiterms.tw/terms/laplace-smoothing
快查頁：https://aiterms.tw/terms/laplace-smoothing
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-laplace-smoothing