---
title: "生成式模型（Generative Model）"
slug: generative-model
language: zh-TW
source: https://aiterms.tw/learning/what-is-generative-model
updated_at: 2026-06-22
tags: [生成式AI, 深度學習, 大型語言模型, 模型訓練]
ipas_term: false
type: deep-dive
---

# 生成式模型 是什麼？

> 生成式模型（Generative Model）是能夠學習資料的機率分布並從中生成新樣本的機器學習模型，涵蓋 GAN、VAE、擴散模型等架構，廣泛應用於影像合成、文字生成與資料擴增。

## 核心概念

生成式模型的核心目標是對資料的真實分布 P_data(x) 建模，並能從中採樣生成新的資料點 x'，使得 x' 與訓練資料在統計特性上相符。這與判別式模型的根本差異在於：判別式模型僅學習決策邊界（給定輸入，預測哪個類別），而生成式模型學習的是整個資料空間的結構。

從貝氏觀點看，生成式模型建模聯合機率 P(x, y) 或邊際機率 P(x)，可推導出條件機率 P(y|x)，因此理論上生成式模型能同時完成分類與生成兩種任務。

## 運作原理

### 生成對抗網路（GAN）

GAN 由生成器（Generator）和判別器（Discriminator）兩個網路組成。生成器從隨機噪聲 z 生成假樣本，判別器學習區分真假。兩者透過對抗訓練交替優化，最終生成器學會產生以假亂真的樣本。GAN 的核心困難在於訓練不穩定，容易出現模式崩潰（Mode Collapse）問題。

### 變分自編碼器（VAE）

VAE 將輸入資料編碼至潛在空間（Latent Space）的機率分布（通常為高斯分布），再從分布中採樣並解碼回資料空間。訓練目標結合重建損失和 KL 散度（衡量潛在分布與先驗分布的差距），使潛在空間具有結構性和連續性，便於插值生成。

### 自回歸模型

GPT、LLaMA 等大型語言模型採用自回歸生成方式，將序列生成機率分解為：

P(x) = ∏ P(x_t | x_1, ..., x_{t-1})

每次生成一個 token，並以已生成的序列為條件。這種方式在文字生成上效果卓越，但生成速度受序列長度限制。

### 擴散模型（Diffusion Model）

擴散模型透過逐步加入高斯噪聲將真實資料「破壞」，再訓練網路學習反向去噪過程。推論時從純噪聲出發，經過數百至數千步去噪還原出高品質樣本。穩定擴散（Stable Diffusion）和 DALL-E 3 均基於此原理。

## 實際應用

### 影像生成與編輯

文生圖模型（Text-to-Image）如 Midjourney、Stable Diffusion 等均基於生成式模型，能根據自然語言描述合成高解析度影像。影像修復（Inpainting）、風格轉換（Style Transfer）也廣泛採用 GAN 或擴散模型架構。

### 大型語言模型

ChatGPT、Claude、Gemini 等對話 AI 的底層均為大型自回歸語言模型，本質上是一種文字生成模型，透過預測下一個 token 學習語言的統計結構。

### 資料擴增

在醫療影像、自動駕駛等資料稀缺場景，生成式模型可合成標記資料以擴充訓練集，降低資料蒐集成本並提升模型泛化能力。

### 藥物探索

生成式模型用於分子設計，從現有藥物分子的分布中生成具有特定化學性質的新分子候選，加速新藥研發流程。

## 常見誤區

### 誤區一：生成式 AI = 生成式模型

「生成式 AI」是一個應用層概念，泛指能生成內容的 AI 系統；「生成式模型」是一個統計機器學習概念，指學習資料分布的模型類別。並非所有生成式 AI 都在數學上等同於生成式模型（例如部分檢索增強生成系統結合了生成與檢索兩種機制）。

### 誤區二：GAN 已被擴散模型完全取代

在影像生成品質上，擴散模型目前通常優於 GAN，但 GAN 在推論速度上仍有優勢（GAN 單次前向傳播即可生成樣本，擴散模型需多步去噪）。在即時影像生成、視訊生成等對速度要求高的場景，GAN 仍是重要選項。

### 誤區三：生成式模型只能用於創意任務

生成式模型同樣用於科學計算（蛋白質結構預測的 AlphaFold 使用擴散思想）、異常偵測（從正常資料分布學習，偵測偏離樣本）以及資料補全（填補感測器缺失值）等嚴肅的工程任務。

## 與相關技術的比較

| 模型類型 | 代表架構 | 優勢 | 主要限制 |
|---|---|---|---|
| GAN | StyleGAN, CycleGAN | 生成速度快、影像品質高 | 訓練不穩定、模式崩潰 |
| VAE | Beta-VAE, VQ-VAE | 潛在空間結構化、可插值 | 生成樣本較模糊 |
| 自回歸模型 | GPT, LLaMA | 文字生成品質高 | 生成速度受序列長度限制 |
| 擴散模型 | Stable Diffusion, DALL-E | 影像品質高、多樣性好 | 推論步驟多、速度慢 |
| 流模型 | Normalizing Flow | 精確密度估計、可逆 | 架構限制多、規模化困難 |

## 常見問題

### 生成式模型和判別式模型的根本差異是什麼？

判別式模型（如 SVM、傳統分類神經網路）學習從輸入到輸出的映射，也就是條件機率 P(y|x)，目標是「給定這個輸入，最可能的標籤是什麼」。生成式模型學習的是資料本身的聯合機率 P(x) 或 P(x, y)，目標是「這類資料的生成機制是什麼，我能從中造出新的樣本嗎」。實務上，判別式模型在有充足標記資料的分類任務中往往效能更高；生成式模型的優勢在於能生成新樣本、處理無標記資料，以及在資料量少時利用對資料結構的建模進行更好的泛化。

### GAN 訓練的模式崩潰問題如何緩解？

模式崩潰（Mode Collapse）指生成器只學會生成有限幾種樣本，而忽略訓練資料的其他模式。常見緩解策略包含：採用 Wasserstein GAN（WGAN）改用更穩定的 Wasserstein 距離替代原始 JS 散度；使用 Minibatch Discrimination 讓判別器感知批次內的多樣性；採用漸進式訓練（Progressive Growing）從低解析度逐步增長；或以條件 GAN（Conditional GAN）提供類別資訊引導生成。在許多高品質影像生成任務中，業界已轉向擴散模型以規避 GAN 的訓練穩定性問題。

### iPAS 考題中生成式模型常測驗哪些知識點？

iPAS 中級考題常從三個角度測驗生成式模型：一是架構辨識（VAE 的 ELBO 損失函數、GAN 的對抗訓練機制、擴散模型的去噪過程）；二是生成式 vs 判別式模型的比較（學習 P(x) 還是 P(y|x)、各自的應用場景與優缺點）；三是生成模型的評估指標（Fréchet Inception Distance, FID 衡量影像生成品質；Inception Score, IS；BLEU/ROUGE 用於文字生成）。考生需能從題目的問題描述中快速判斷題目屬於哪個架構類別，並掌握各架構的核心訓練目標。

---

深度解說頁：https://aiterms.tw/learning/what-is-generative-model
快查頁：https://aiterms.tw/terms/generative-model
最後更新：2026/06/22