模式崩潰(Mode Collapse)是什麼?

GAN 訓練時生成器只輸出少數幾種重複樣本而喪失多樣性的訓練失敗現象。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Mode Collapse
主題標籤
生成式AI、GAN、模型訓練
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
模式崩潰(Mode Collapse)是什麼? 生成式AIGAN
術語快查

搜尋意圖: 如果你在找「模式崩潰 是什麼」或「模式崩潰 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: GAN 訓練時生成器只輸出少數幾種重複樣本而喪失多樣性的訓練失敗現象。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

GAN 訓練時生成器只輸出少數幾種重複樣本而喪失多樣性的訓練失敗現象。

模式崩潰(Mode Collapse)是生成對抗網路(GAN)訓練過程中最常見、也最令研究者頭痛的失敗現象之一。在理想情況下,GAN 的生成器應當學習逼近整個真實資料分布(Distribution),例如人臉資料集中應涵蓋各種膚色、年齡、表情、角度;但發生模式崩潰時,生成器只輸出分布中的少數幾個「模式」,甚至退化到反覆輸出幾乎相同的圖片。

成因:賽局理論視角

GAN 的訓練本質是生成器(Generator, G)與判別器(Discriminator, D)的零和賽局。判別器的目標是區分真實樣本與生成樣本,生成器的目標是欺騙判別器。當生成器發現某幾個特定輸出能穩定欺騙判別器時(這些輸出對判別器來說「看起來很真實」),數學上將這幾個輸出反覆生成就是局部最優策略。生成器不需要探索整個資料分布,只要找到幾個「高分捷徑」即可,這就是模式崩潰的根本動機。

識別模式崩潰的方法

  • 視覺直接觀察:生成的批次樣本中出現高度雷同的圖像,例如生成的 MNIST 數字只有「0」和「1」,而沒有其他數字
  • FID 分數(Fréchet Inception Distance)異常偏高:FID 衡量生成分布與真實分布之間的距離,崩潰時因多樣性喪失,FID 大幅上升
  • 潛在空間插值測試:在連續的潛在向量空間做線性插值,若插值結果幾乎不變化,說明潛在空間的不同區域都映射到相同輸出
  • 判別器損失過快收斂到常數:當判別器損失不再改善,可能是生成器已鎖定特定輸出讓判別器也無法再分辨

主要緩解策略及其原理

Mini-batch Discrimination:讓判別器不只看單張圖,而是同時看一整個批次的樣本,並將批次內部的相似度資訊納入判斷。如果生成器反覆輸出相同樣本,判別器就能偵測到「這個批次太同質」,給出負面反饋,迫使生成器增加多樣性。

Wasserstein GAN(WGAN):把傳統 GAN 的損失函數改成 Wasserstein 距離(Earth Mover's Distance),提供更穩定的梯度訊號。傳統 GAN 的損失函數當生成分布與真實分布不重疊時梯度可能消失或爆炸;WGAN 的梯度更平滑,減少訓練不穩定與崩潰的傾向。

Unrolled GAN:生成器在更新時不只考慮當前判別器的反應,而是「展開」預測判別器未來幾步更新後的狀態再優化,避免過度針對當前判別器的特定弱點,使訓練更長遠穩定。

多樣性正則化(Diversity Regularization):在生成器的損失函數中加入明確鼓勵輸出多樣性的懲罰項,例如對批次內生成樣本的相似度給予損失懲罰,直接在目標函數層面要求多樣性。

在現代 AI 生成系統中的延伸意義 雖然影像生成領域已大量從 GAN 轉向擴散模型(Diffusion Models),後者因訓練穩定性優異而幾乎不出現典型模式崩潰,但「多樣性喪失」的問題仍以不同形式存在於強化學習(策略坍縮到少數動作)、語言模型微調(過度擬合少數模式)等場景。理解模式崩潰的本質對分析任何「生成系統陷入重複輸出」的問題都有指導意義。

評估模式崩潰嚴重程度的量化指標 除了 FID 分數,研究者也用「模式覆蓋率(Mode Coverage)」和「回憶率(Recall)」評估崩潰程度。Precision 衡量生成樣本的品質(落在真實分布內的比例),Recall 衡量生成樣本對真實分布的覆蓋程度(真實分布中有多少區域被生成樣本覆蓋)。模式崩潰時 Recall 偏低,即使 Precision 可能不錯。完整的 GAN 評估應同時報告 FID、Precision、Recall 三個指標。

常見問題

為什麼模式崩潰在 GAN 中比其他生成模型更常見?

因為 GAN 的訓練本質是對抗賽局,生成器的梯度訊號完全來自判別器的即時反應,而不是對真實資料分布的直接估計。當生成器找到幾個固定輸出能穩定欺騙判別器時,這些輸出就是數學上的局部最優解,生成器沒有強制探索整個分布的動機。相比之下,VAE 透過重建損失直接要求輸出接近輸入,有明確的多樣性壓力;Diffusion Model 的前向/反向過程是對整個資料分布的建模,不存在對抗賽局的退化捷徑。

遇到模式崩潰時,實務上應該按什麼順序嘗試解決方案?

建議依照難度由低到高的順序:1)首先嘗試調整學習率,特別是降低生成器的學習率或採用不對稱學習率(生成器慢、判別器快),讓訓練動態更平衡;2)改用 WGAN 或 WGAN-GP(帶梯度懲罰),它提供更穩定的梯度訊號,從理論上緩解崩潰;3)加入 Mini-batch Discrimination,讓判別器能感知批次多樣性;4)調整架構,如增加生成器容量、調整 Batch Normalization 位置;5)若以上都無效,考慮切換到 Diffusion Model 架構,從根本上避免 GAN 的對抗不穩定性問題。

模式崩潰和梯度消失有什麼關係?

兩者是 GAN 訓練中相關但不同的問題。梯度消失(Gradient Vanishing)通常發生在判別器訓練得過於完美時:判別器能輕易區分真實與生成樣本,對生成器輸出的 loss 接近飽和(JS 散度的梯度趨近於 0),使生成器幾乎沒有可用的梯度訊號,訓練停滯。而模式崩潰則是相反的情況:生成器找到了幾個能穩定欺騙判別器的輸出,梯度訊號確實存在,但指引方向錯了,引導生成器鎖定在少數模式。WGAN 用 Wasserstein 距離取代 JS 散度,可同時緩解梯度消失和模式崩潰。