模式崩潰 是什麼?

Mode Collapse:模式崩潰 的完整解釋

GAN 訓練時生成器只輸出少數幾種重複樣本而喪失多樣性的訓練失敗現象。

模式崩潰(Mode Collapse)是生成對抗網路(GAN)訓練過程中最常見、也最令研究者頭痛的失敗現象之一。在理想情況下,GAN 的生成器應當學習逼近整個真實資料分布(Distribution),例如人臉資料集中應涵蓋各種膚色、年齡、表情、角度;但發生模式崩潰時,生成器只輸出分布中的少數幾個「模式」,甚至退化到反覆輸出幾乎相同的圖片。

成因:賽局理論視角

GAN 的訓練本質是生成器(Generator, G)與判別器(Discriminator, D)的零和賽局。判別器的目標是區分真實樣本與生成樣本,生成器的目標是欺騙判別器。當生成器發現某幾個特定輸出能穩定欺騙判別器時(這些輸出對判別器來說「看起來很真實」),數學上將這幾個輸出反覆生成就是局部最優策略。生成器不需要探索整個資料分布,只要找到幾個「高分捷徑」即可,這就是模式崩潰的根本動機。

識別模式崩潰的方法

  • 視覺直接觀察:生成的批次樣本中出現高度雷同的圖像,例如生成的 MNIST 數字只有「0」和「1」,而沒有其他數字
  • FID 分數(Fréchet Inception Distance)異常偏高:FID 衡量生成分布與真實分布之間的距離,崩潰時因多樣性喪失,FID 大幅上升
  • 潛在空間插值測試:在連續的潛在向量空間做線性插值,若插值結果幾乎不變化,說明潛在空間的不同區域都映射到相同輸出
  • 判別器損失過快收斂到常數:當判別器損失不再改善,可能是生成器已鎖定特定輸出讓判別器也無法再分辨

主要緩解策略及其原理

Mini-batch Discrimination:讓判別器不只看單張圖,而是同時看一整個批次的樣本,並將批次內部的相似度資訊納入判斷。如果生成器反覆輸出相同樣本,判別器就能偵測到「這個批次太同質」,給出負面反饋,迫使生成器增加多樣性。

Wasserstein GAN(WGAN):把傳統 GAN 的損失函數改成 Wasserstein 距離(Earth Mover's Distance),提供更穩定的梯度訊號。傳統 GAN 的損失函數當生成分布與真實分布不重疊時梯度可能消失或爆炸;WGAN 的梯度更平滑,減少訓練不穩定與崩潰的傾向。

Unrolled GAN:生成器在更新時不只考慮當前判別器的反應,而是「展開」預測判別器未來幾步更新後的狀態再優化,避免過度針對當前判別器的特定弱點,使訓練更長遠穩定。

多樣性正則化(Diversity Regularization):在生成器的損失函數中加入明確鼓勵輸出多樣性的懲罰項,例如對批次內生成樣本的相似度給予損失懲罰,直接在目標函數層面要求多樣性。

在現代 AI 生成系統中的延伸意義 雖然影像生成領域已大量從 GAN 轉向擴散模型(Diffusion Models),後者因訓練穩定性優異而幾乎不出現典型模式崩潰,但「多樣性喪失」的問題仍以不同形式存在於強化學習(策略坍縮到少數動作)、語言模型微調(過度擬合少數模式)等場景。理解模式崩潰的本質對分析任何「生成系統陷入重複輸出」的問題都有指導意義。

評估模式崩潰嚴重程度的量化指標 除了 FID 分數,研究者也用「模式覆蓋率(Mode Coverage)」和「回憶率(Recall)」評估崩潰程度。Precision 衡量生成樣本的品質(落在真實分布內的比例),Recall 衡量生成樣本對真實分布的覆蓋程度(真實分布中有多少區域被生成樣本覆蓋)。模式崩潰時 Recall 偏低,即使 Precision 可能不錯。完整的 GAN 評估應同時報告 FID、Precision、Recall 三個指標。

常見問題