生成對抗網路 是什麼?
Generative Adversarial Network:生成對抗網路 的完整解釋
生成對抗網路是一種透過生成器與鑑別器互相對抗學習,最終使生成器能產出逼真資料的深度學習模型
容易混淆
GAN vs 變分自編碼器 VAE 偏向先學分布再重建,結果常比較平滑。 GAN 偏向對抗逼真,生成結果通常更銳利。
GAN vs 一般分類模型 分類模型是判斷類別。 GAN 是生成新樣本,目標完全不同。
記住這句就好
一個負責造,一個負責抓,互相對抗就是 GAN。
實際案例
醫療影像增強 少見病灶資料太少時,可以用 GAN 補強訓練素材,但仍要仔細檢查品質。
人臉生成 GAN 可以生成看起來很像真的人臉、風格圖像或藝術圖案。
算法與應用
它由生成器和鑑別器組成,訓練時讓兩者彼此拉扯,生成器不斷修正輸出。 常見挑戰包含訓練不穩定、模式崩潰和評估困難,但在影像任務裡仍很有代表性。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 生成對抗網路 | 台灣教科書與考試用語 |
| 生成对抗网络 | 中國大陸用語,簡體資料裡幾乎都寫這個 |
| Generative Adversarial Network | 論文原名,Ian Goodfellow 等人於 2014 年提出 |
| GAN | 縮寫,讀作「乾」或逐字母念 |
| 對抗式生成網路 | 少見的中文變體,指的是同一件事 |
運作核心:兩個網路互相對抗
考題最常問的就是「運作核心為何」,答案是生成器與判別器的對抗訓練。
生成器(Generator) 吃一個隨機雜訊向量,吐出一張假圖。它的目標是騙過判別器。
判別器(Discriminator) 吃一張圖,判斷是真實資料還是生成器造的。它的目標是不被騙。
兩者輪流更新:判別器變強,生成器就必須造得更像;生成器變像,判別器就必須看得更細。理論上的平衡點是判別器對任何輸入都只能猜 50%,也就是再也分不出真假。
這個「一個要騙、一個要抓」的零和結構,就是「對抗(adversarial)」這個字的來源,也是它跟自編碼器、擴散模型最根本的差別:GAN 沒有明確的重建誤差,它的訓練訊號完全來自另一個網路的判斷。
為什麼 GAN 很難訓練
模式崩潰(mode collapse):生成器發現某一種輸出特別容易騙過判別器,就一直產出那一種,多樣性歸零。症狀是生成的圖看起來都很像。
訓練不穩定:兩個網路的強弱要維持平衡。判別器太強,生成器拿不到有用的梯度,學不動;生成器太強,判別器變成瞎猜,同樣沒有訊號。
沒有明確的收斂指標:損失值上下震盪是正常的,看損失曲線判斷不出訓練好壞,實務上只能靠人眼看樣本或用 FID 這類分數評估。
這些問題是擴散模型(diffusion model)近年在影像生成上取代 GAN 的主要原因:擴散模型的訓練目標是單一的去噪損失,穩定很多。GAN 的優勢仍在推論速度,它一次前向就出圖,不需要幾十步迭代。
生成對抗網路 在 iPAS 考試中的重點
根據歷年統計,生成對抗網路 相關題目 平均佔 AI 技術類考題 3%, 屬於未分類考範圍。
常見出題方向:生成對抗網路的演算法原理(40%)、模型架構與訓練策略(35%)、生成模型應用與評估(25%)。
相關術語
常見問題
GAN 為什麼訓練難?
因為兩個網路在互相拉扯,平衡不好就容易不穩。
它只適合生成圖片嗎?
不只,但圖片是最常見、也最容易看出效果的場景。
模式崩潰是什麼?
生成器只會產生少數幾種樣本,失去多樣性。
GAN 一定比 VAE 更好嗎?
不一定,GAN 可能更逼真,VAE 常更穩,取捨看任務。
資料來源
- iPAS AI 應用規劃師評鑑內容範圍參考(115.02) ,經濟部產業人才能力鑑定