變分自編碼器 是什麼?

Variational Autoencoder:變分自編碼器 的完整解釋

變分自編碼器(VAE)是一種生成式深度學習模型,它將輸入資料壓縮成潛在空間中的機率分佈,並能從中採樣以生成多樣化且具代表性的新資料樣本。

容易混淆

變分自編碼器 vs 自編碼器 自編碼器主要做壓縮和重建 變分自編碼器還會學分布並做抽樣 最關鍵的區別:能不能生成新樣本

變分自編碼器 vs 生成對抗網路 VAE 直接優化重建和分布 GAN 用對抗訓練拉近真假差距 最關鍵的區別:訓練目標不同

變分自編碼器 vs 擴散模型 VAE 走潛在空間重建路線 擴散模型走去噪生成路線 最關鍵的區別:生成機制不同

記住這句就好

先壓進潛在空間,再從分布裡抽樣長回來。

實際案例

圖片生成 把臉部圖片壓進潛在空間後,能從相近的位置抽樣出新臉,做出有連續感的變化

異常偵測 模型若很難重建某張圖,常表示它和訓練資料分布差很多,可能是異常

算法與應用

| 編碼器 | 把輸入壓成潛在表示 | 不只是單點,而是分布 | | 重參數化 | 讓抽樣可微分 | 是訓練關鍵技巧 | | 解碼器 | 從潛在表示重建資料 | 也能拿來生成 | | 潛在空間 | 用連續空間表示樣本 | 方便插值和取樣 |

中英對照與常見說法

說法 出現場合
變分自編碼器 台灣正式用語
变分自动编码器、变分自编码器 簡體寫法,兩種都常見
Variational Autoencoder 英文原名
VAE 標準縮寫

跟一般自編碼器差在哪

自編碼器(AE) 變分自編碼器(VAE)
編碼器輸出 一個固定的向量 一個機率分布的平均值與變異數
潛空間 可能有空洞,隨便取一點解碼出來是雜訊 被約束成接近標準常態分布,連續且完整
能不能生成新樣本 不能,它只會重建 能,從分布裡取樣就能生成
損失函數 只有重建誤差 重建誤差加上 KL 散度

關鍵差別在潛空間有沒有被約束。一般自編碼器只要求「壓縮後還原得回來」,中間長什麼樣它不管,所以潛空間會有一塊一塊沒被用到的區域,在那裡取樣解碼只會得到雜訊。VAE 多了一項 KL 散度,逼迫編碼結果貼近標準常態分布,潛空間因此變得連續,任取一點都解得出合理的東西。

兩個關鍵設計

重參數化技巧(reparameterization trick)。從分布取樣這個動作本身不可微,梯度傳不回編碼器。做法是把取樣改寫成「平均值加上標準差乘以一個外部的標準常態雜訊」,隨機性被隔離在那個外部雜訊裡,梯度就能順利通過。這是 VAE 能用反向傳播訓練的關鍵。

兩個損失要平衡。重建誤差要模型還原得像,KL 散度要潛空間規矩,兩者方向相反。KL 權重太大會出現後驗塌陷(posterior collapse):模型乾脆忽略潛變數,輸出所有樣本的平均,畫面糊成一團。權重太小則退化回一般自編碼器,失去生成能力。β-VAE 就是把這個權重明確拉出來當旋鈕的變體。

VAE 生成的影像通常比 GAN 或擴散模型模糊,因為重建損失多半用均方誤差,而均方誤差在不確定時的最佳解就是取平均。這也是為什麼現在的影像生成主流不是純 VAE,但 VAE 的編碼器與解碼器仍被大量使用:潛在擴散模型(如 Stable Diffusion)就是拿 VAE 把影像壓進潛空間,再在那裡跑擴散。

情境判斷

Q1(直覺題):你要做可插值的生成模型,變分自編碼器有幫助嗎? → 有幫助,因為它的潛在空間通常比較連續。

Q2(判斷題):你要追求最銳利最逼真的圖片,VAE 一定是最佳選擇嗎? → 不一定,VAE 有時會偏平滑,這時其他生成法可能更強。

變分自編碼器 在 iPAS 考試中的重點

根據歷年統計,變分自編碼器 相關題目 平均佔 AI 技術類考題 4%, 屬於未分類考範圍。

常見出題方向:變分自編碼器的演算法原理與架構(40%)、生成模型與機率推論的數學基礎(35%)、VAE 的應用與限制分析(25%)。

相關術語

常見問題

VAE 和自編碼器差在哪?

VAE 多了分布假設和抽樣能力,不只是重建。

它為什麼叫變分?

因為訓練時會用變分推論的想法來近似複雜分布。

VAE 一定比 GAN 好嗎?

不一定,兩者擅長的目標不同。

資料來源

← 回到 變分自編碼器 快查頁

測驗你對 變分自編碼器 的理解

透過模擬考系統檢驗學習成果

開始測驗