生成式模型 是什麼?

Generative Model:生成式模型 的完整解釋

生成式模型(Generative Model)是能夠學習資料的機率分布並從中生成新樣本的機器學習模型,涵蓋 GAN、VAE、擴散模型等架構,廣泛應用於影像合成、文字生成與資料擴增。

核心概念

生成式模型的核心目標是對資料的真實分布 P_data(x) 建模,並能從中採樣生成新的資料點 x',使得 x' 與訓練資料在統計特性上相符。這與判別式模型的根本差異在於:判別式模型僅學習決策邊界(給定輸入,預測哪個類別),而生成式模型學習的是整個資料空間的結構。

從貝氏觀點看,生成式模型建模聯合機率 P(x, y) 或邊際機率 P(x),可推導出條件機率 P(y|x),因此理論上生成式模型能同時完成分類與生成兩種任務。

運作原理

生成對抗網路(GAN)

GAN 由生成器(Generator)和判別器(Discriminator)兩個網路組成。生成器從隨機噪聲 z 生成假樣本,判別器學習區分真假。兩者透過對抗訓練交替優化,最終生成器學會產生以假亂真的樣本。GAN 的核心困難在於訓練不穩定,容易出現模式崩潰(Mode Collapse)問題。

變分自編碼器(VAE)

VAE 將輸入資料編碼至潛在空間(Latent Space)的機率分布(通常為高斯分布),再從分布中採樣並解碼回資料空間。訓練目標結合重建損失和 KL 散度(衡量潛在分布與先驗分布的差距),使潛在空間具有結構性和連續性,便於插值生成。

自回歸模型

GPT、LLaMA 等大型語言模型採用自回歸生成方式,將序列生成機率分解為:

P(x) = ∏ P(x_t | x_1, ..., x_{t-1})

每次生成一個 token,並以已生成的序列為條件。這種方式在文字生成上效果卓越,但生成速度受序列長度限制。

擴散模型(Diffusion Model)

擴散模型透過逐步加入高斯噪聲將真實資料「破壞」,再訓練網路學習反向去噪過程。推論時從純噪聲出發,經過數百至數千步去噪還原出高品質樣本。穩定擴散(Stable Diffusion)和 DALL-E 3 均基於此原理。

實際應用

影像生成與編輯

文生圖模型(Text-to-Image)如 Midjourney、Stable Diffusion 等均基於生成式模型,能根據自然語言描述合成高解析度影像。影像修復(Inpainting)、風格轉換(Style Transfer)也廣泛採用 GAN 或擴散模型架構。

大型語言模型

ChatGPT、Claude、Gemini 等對話 AI 的底層均為大型自回歸語言模型,本質上是一種文字生成模型,透過預測下一個 token 學習語言的統計結構。

資料擴增

在醫療影像、自動駕駛等資料稀缺場景,生成式模型可合成標記資料以擴充訓練集,降低資料蒐集成本並提升模型泛化能力。

藥物探索

生成式模型用於分子設計,從現有藥物分子的分布中生成具有特定化學性質的新分子候選,加速新藥研發流程。

常見誤區

誤區一:生成式 AI = 生成式模型

「生成式 AI」是一個應用層概念,泛指能生成內容的 AI 系統;「生成式模型」是一個統計機器學習概念,指學習資料分布的模型類別。並非所有生成式 AI 都在數學上等同於生成式模型(例如部分檢索增強生成系統結合了生成與檢索兩種機制)。

誤區二:GAN 已被擴散模型完全取代

在影像生成品質上,擴散模型目前通常優於 GAN,但 GAN 在推論速度上仍有優勢(GAN 單次前向傳播即可生成樣本,擴散模型需多步去噪)。在即時影像生成、視訊生成等對速度要求高的場景,GAN 仍是重要選項。

誤區三:生成式模型只能用於創意任務

生成式模型同樣用於科學計算(蛋白質結構預測的 AlphaFold 使用擴散思想)、異常偵測(從正常資料分布學習,偵測偏離樣本)以及資料補全(填補感測器缺失值)等嚴肅的工程任務。

與相關技術的比較

模型類型 代表架構 優勢 主要限制
GAN StyleGAN, CycleGAN 生成速度快、影像品質高 訓練不穩定、模式崩潰
VAE Beta-VAE, VQ-VAE 潛在空間結構化、可插值 生成樣本較模糊
自回歸模型 GPT, LLaMA 文字生成品質高 生成速度受序列長度限制
擴散模型 Stable Diffusion, DALL-E 影像品質高、多樣性好 推論步驟多、速度慢
流模型 Normalizing Flow 精確密度估計、可逆 架構限制多、規模化困難

常見問題