判別模型 是什麼?
Discriminative Model:判別模型 的完整解釋
直接學習輸入特徵與輸出類別之間條件機率 P(Y|X) 的機器學習模型。
判別模型(Discriminative Model)是機器學習分類架構中的核心概念,理解它需要從「生成模型 vs. 判別模型」這對基本對照開始。
核心定義
機器學習的分類任務本質上是在給定輸入 X 的情況下預測輸出 Y。這個目標可以用兩種不同的思路來實現:
生成模型(Generative Model):先建模輸入資料的生成過程,即聯合分布 P(X, Y) 或類別條件分布 P(X|Y),再透過貝葉斯定理推導出條件機率 P(Y|X)。生成模型不只是學習分類,還學習了「這類資料長什麼樣」。
判別模型(Discriminative Model):直接建模條件機率 P(Y|X),或直接學習一個將 X 映射到 Y 的函數(如決策邊界),不對 P(X) 建立任何假設。判別模型只關心「如何區分不同類別」,而不關心每個類別的資料是如何生成的。
典型的判別模型
- 邏輯回歸(Logistic Regression):最典型的判別機率模型,直接對 P(Y=1|X) 進行建模,使用 Sigmoid 函數將線性組合映射到 [0,1]。
- 支持向量機(SVM):尋找能最大化類別間隔(Margin)的超平面決策邊界,不對 P(X) 做任何假設。
- 決策樹(Decision Tree)與隨機森林(Random Forest):透過特徵分裂直接學習分類規則。
- 條件隨機場(CRF,Conditional Random Field):在序列標注任務中廣泛使用的判別模型,直接建模 P(Y|X) 而非 P(X, Y)。
- 深度神經網路(Deep Neural Network):現代深度學習中的分類網路(如 ResNet、ViT 等分類器)都是判別模型,最後一層通常為 Softmax,直接輸出各類別的條件機率。
判別模型 vs. 生成模型的對比
| 面向 | 判別模型 | 生成模型 |
|---|---|---|
| 建模目標 | P(Y|X) 或決策邊界 | P(X, Y) 或 P(X|Y) |
| 代表方法 | 邏輯回歸、SVM、深度分類器 | 樸素貝葉斯、GMM、VAE、GAN |
| 分類準確度 | 通常較高 | 相同資料量下通常較低 |
| 資料生成能力 | 無(只能分類) | 有(可生成新資料) |
| 小樣本表現 | 通常需要較多資料 | 有時可從少量資料建模分布 |
| 計算效率 | 通常較高 | 通常較低(需建模整個資料分布) |
為什麼判別模型通常在分類任務上表現更好?
直觀原因:判別模型把所有建模能力都集中在「學習類別邊界」這一個目標上,而生成模型還要花費容量去建模每個類別的資料分布(這對分類來說是不必要的資訊)。Andrew Ng 和 Michael Jordan 於 2002 年的著名論文從理論上分析了這一點:判別模型(如邏輯回歸)在資料量充足時的漸近表現優於對應的生成模型(如樸素貝葉斯);但在資料量非常少時,生成模型的歸納偏置(Inductive Bias)可能使其收斂更快。
應用場景
需要高精度分類或回歸預測的任務通常選用判別模型,例如圖像分類、垃圾郵件偵測、信用評分、醫療診斷分類等。若任務同時需要資料生成、異常偵測或估計資料分布,則可能需要生成模型。
與現代 AI 的關聯
現代生成式 AI(如 LLM、擴散模型)興起後,生成模型受到更多關注。但即便是 LLM,其核心的「下一詞預測」(Causal LM)也可以視為一種判別模型(給定前文,預測下一詞的條件機率)。兩種範式在現代 AI 系統中常常相互融合、各取所長。