搜尋意圖: 如果你在找「生成式模型 是什麼」或「生成式模型 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 生成式模型(Generative Model)是能夠學習資料的機率分布並從中生成新樣本的機器學習模型,涵蓋 GAN、VAE、擴散模型等架構,廣泛應用於影像合成、文字生成與資料擴增。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
生成式模型(Generative Model)是能夠學習資料的機率分布並從中生成新樣本的機器學習模型,涵蓋 GAN、VAE、擴散模型等架構,廣泛應用於影像合成、文字生成與資料擴增。
核心概念
生成式模型的核心目標是對資料的真實分布 P_data(x) 建模,並能從中採樣生成新的資料點 x',使得 x' 與訓練資料在統計特性上相符。這與判別式模型的根本差異在於:判別式模型僅學習決策邊界(給定輸入,預測哪個類別),而生成式模型學習的是整個資料空間的結構。
從貝氏觀點看,生成式模型建模聯合機率 P(x, y) 或邊際機率 P(x),可推導出條件機率 P(y|x),因此理論上生成式模型能同時完成分類與生成兩種任務。
運作原理
生成對抗網路(GAN)
GAN 由生成器(Generator)和判別器(Discriminator)兩個網路組成。生成器從隨機噪聲 z 生成假樣本,判別器學習區分真假。兩者透過對抗訓練交替優化,最終生成器學會產生以假亂真的樣本。GAN 的核心困難在於訓練不穩定,容易出現模式崩潰(Mode Collapse)問題。
變分自編碼器(VAE)
VAE 將輸入資料編碼至潛在空間(Latent Space)的機率分布(通常為高斯分布),再從分布中採樣並解碼回資料空間。訓練目標結合重建損失和 KL 散度(衡量潛在分布與先驗分布的差距),使潛在空間具有結構性和連續性,便於插值生成。
自回歸模型
GPT、LLaMA 等大型語言模型採用自回歸生成方式,將序列生成機率分解為:
P(x) = ∏ P(x_t | x_1, ..., x_{t-1})
每次生成一個 token,並以已生成的序列為條件。這種方式在文字生成上效果卓越,但生成速度受序列長度限制。
擴散模型(Diffusion Model)
擴散模型透過逐步加入高斯噪聲將真實資料「破壞」,再訓練網路學習反向去噪過程。推論時從純噪聲出發,經過數百至數千步去噪還原出高品質樣本。穩定擴散(Stable Diffusion)和 DALL-E 3 均基於此原理。
實際應用
影像生成與編輯
文生圖模型(Text-to-Image)如 Midjourney、Stable Diffusion 等均基於生成式模型,能根據自然語言描述合成高解析度影像。影像修復(Inpainting)、風格轉換(Style Transfer)也廣泛採用 GAN 或擴散模型架構。
大型語言模型
ChatGPT、Claude、Gemini 等對話 AI 的底層均為大型自回歸語言模型,本質上是一種文字生成模型,透過預測下一個 token 學習語言的統計結構。
資料擴增
在醫療影像、自動駕駛等資料稀缺場景,生成式模型可合成標記資料以擴充訓練集,降低資料蒐集成本並提升模型泛化能力。
藥物探索
生成式模型用於分子設計,從現有藥物分子的分布中生成具有特定化學性質的新分子候選,加速新藥研發流程。
常見誤區
誤區一:生成式 AI = 生成式模型
「生成式 AI」是一個應用層概念,泛指能生成內容的 AI 系統;「生成式模型」是一個統計機器學習概念,指學習資料分布的模型類別。並非所有生成式 AI 都在數學上等同於生成式模型(例如部分檢索增強生成系統結合了生成與檢索兩種機制)。
誤區二:GAN 已被擴散模型完全取代
在影像生成品質上,擴散模型目前通常優於 GAN,但 GAN 在推論速度上仍有優勢(GAN 單次前向傳播即可生成樣本,擴散模型需多步去噪)。在即時影像生成、視訊生成等對速度要求高的場景,GAN 仍是重要選項。
誤區三:生成式模型只能用於創意任務
生成式模型同樣用於科學計算(蛋白質結構預測的 AlphaFold 使用擴散思想)、異常偵測(從正常資料分布學習,偵測偏離樣本)以及資料補全(填補感測器缺失值)等嚴肅的工程任務。
與相關技術的比較
| 模型類型 | 代表架構 | 優勢 | 主要限制 |
|---|---|---|---|
| GAN | StyleGAN, CycleGAN | 生成速度快、影像品質高 | 訓練不穩定、模式崩潰 |
| VAE | Beta-VAE, VQ-VAE | 潛在空間結構化、可插值 | 生成樣本較模糊 |
| 自回歸模型 | GPT, LLaMA | 文字生成品質高 | 生成速度受序列長度限制 |
| 擴散模型 | Stable Diffusion, DALL-E | 影像品質高、多樣性好 | 推論步驟多、速度慢 |
| 流模型 | Normalizing Flow | 精確密度估計、可逆 | 架構限制多、規模化困難 |
常見問題
生成式模型和判別式模型的根本差異是什麼?
判別式模型(如 SVM、傳統分類神經網路)學習從輸入到輸出的映射,也就是條件機率 P(y|x),目標是「給定這個輸入,最可能的標籤是什麼」。生成式模型學習的是資料本身的聯合機率 P(x) 或 P(x, y),目標是「這類資料的生成機制是什麼,我能從中造出新的樣本嗎」。實務上,判別式模型在有充足標記資料的分類任務中往往效能更高;生成式模型的優勢在於能生成新樣本、處理無標記資料,以及在資料量少時利用對資料結構的建模進行更好的泛化。
GAN 訓練的模式崩潰問題如何緩解?
模式崩潰(Mode Collapse)指生成器只學會生成有限幾種樣本,而忽略訓練資料的其他模式。常見緩解策略包含:採用 Wasserstein GAN(WGAN)改用更穩定的 Wasserstein 距離替代原始 JS 散度;使用 Minibatch Discrimination 讓判別器感知批次內的多樣性;採用漸進式訓練(Progressive Growing)從低解析度逐步增長;或以條件 GAN(Conditional GAN)提供類別資訊引導生成。在許多高品質影像生成任務中,業界已轉向擴散模型以規避 GAN 的訓練穩定性問題。
iPAS 考題中生成式模型常測驗哪些知識點?
iPAS 中級考題常從三個角度測驗生成式模型:一是架構辨識(VAE 的 ELBO 損失函數、GAN 的對抗訓練機制、擴散模型的去噪過程);二是生成式 vs 判別式模型的比較(學習 P(x) 還是 P(y|x)、各自的應用場景與優缺點);三是生成模型的評估指標(Fréchet Inception Distance, FID 衡量影像生成品質;Inception Score, IS;BLEU/ROUGE 用於文字生成)。考生需能從題目的問題描述中快速判斷題目屬於哪個架構類別,並掌握各架構的核心訓練目標。