潛在擴散模型 是什麼?

Latent Diffusion Model:潛在擴散模型 的完整解釋

潛在擴散模型(LDM)是一種生成式AI模型,透過在潛在空間中進行擴散和逆擴散過程,生成高解析度、高品質的圖像或其他資料。

容易混淆

一般擴散模型 一般擴散模型直接處理像素,LDM 先在潛在空間裡工作,速度更快。

GAN GAN 是對抗式生成,LDM 是擴散式生成,訓練方式和生成流程不同。

記住這句就好

先在草圖空間畫,再放大成圖。

實際案例

文字生圖 系統先把文字條件轉成潛在表示,再逐步去雜訊生成高品質圖片。

圖片編輯 做修圖或局部重繪時,LDM 可以在潛在空間裡調整內容,再還原成影像。

算法與應用

LDM 通常結合自編碼器和擴散過程,把高維像素壓到較小的 latent space,再在那裡做生成。這麼做能大幅降計算量,也讓高解析度生成更可行。

中英對照與常見說法

說法 出現場合
潛在擴散模型 台灣正式用語
潜在扩散模型 簡體寫法
Latent Diffusion Model 英文原名
LDM 標準縮寫
潛空間擴散 常見變體

關鍵改動:把擴散搬到潛空間

一般的擴散模型直接在像素上加噪與去噪。一張 512×512 的彩色圖有將近 79 萬個數值,每一步去噪都要在這個維度上算,幾十步下來成本極高。

LDM 的做法是加一個自編碼器:

第一步,用編碼器把影像壓縮到低維的潛空間。壓縮倍率常見是 8 倍,512×512 會變成 64×64,數值量降到約六十四分之一。

第二步,擴散的加噪與去噪全部在這個 64×64 的潛空間裡進行。

第三步,去噪完成後,用解碼器把潛向量還原成影像。

這個改動讓消費級顯示卡也跑得動高解析度生成,Stable Diffusion 就是建立在這個架構上。

代價是自編碼器的重建品質變成上限。潛空間丟掉的細節(極細的紋理、小字)解碼器補不回來,這是文字生成在影像裡常常糊掉的原因之一。

文字怎麼控制生成

文字條件透過交叉注意力(cross-attention) 注入去噪網路。文字先過一個文字編碼器(CLIP 的文字塔或 T5)轉成向量序列,去噪網路的每個區塊裡,影像特徵當 query、文字特徵當 key 與 value,讓每個位置都能參照提示詞。

無分類器導引(Classifier-Free Guidance, CFG) 是控制「多聽話」的旋鈕。做法是同一步同時算一次有提示與一次無提示的預測,再把兩者的差放大。CFG 值調高,畫面更貼近提示但多樣性下降、容易過飽和;調低則更自由但可能偏離需求。

取樣器(sampler)決定去噪的步數與路徑。 DDIM、DPM-Solver 這類方法能在二十步左右得到不錯的結果,比原始 DDPM 的上千步快得多。步數不是越多越好,超過一定數量之後畫面幾乎不再變化,只是白花時間。

情境判斷

Q1(直覺題): 如果你現在遇到一個 文字生圖 的場景,這個概念會是第一個想到的工具嗎? → 看情況,但如果任務目標和這個概念的用途一致,就很可能是。核心還是先確認你要解決的是分類、分群、壓縮、檢索,還是最佳化。

Q2(判斷題): 如果你把它和 GAN 一起用,結果反而變不穩,通常該怎麼想? → 看情況。先檢查資料分布、特徵定義和模型假設是否相容,很多時候不是概念本身有問題,而是使用條件不對,像距離尺度沒對齊、標註規則不一致,或輸入格式不合。

相關術語

常見問題

潛在擴散模型 最容易跟 一般擴散模型 混淆嗎?

一般擴散模型直接處理像素,LDM 先在潛在空間裡工作,速度更快。

什麼情況會用到 潛在擴散模型?

你可以把它想成先在草圖上修改,再把草圖放大成成品,省很多計算。 實務上只要你要處理和這個概念相符的任務,就會用到它。

初學者最常錯在哪裡?

GAN 是對抗式生成,LDM 是擴散式生成,訓練方式和生成流程不同。