搜尋意圖: 如果你在找「潛在擴散模型 是什麼」或「潛在擴散模型 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 潛在擴散模型(LDM)是一種生成式AI模型,透過在潛在空間中進行擴散和逆擴散過程,生成高解析度、高品質的圖像或其他資料。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
生成圖片時,為什麼有些模型不用直接在像素上慢慢畫,而是先在更小的空間裡做?
你可以把它想成先在草圖上修改,再把草圖放大成成品,省很多計算。
潛在擴散模型(LDM)是一種生成式AI模型,透過在潛在空間中進行擴散和逆擴散過程,生成高解析度、高品質的圖像或其他資料。
容易混淆
一般擴散模型 一般擴散模型直接處理像素,LDM 先在潛在空間裡工作,速度更快。
GAN GAN 是對抗式生成,LDM 是擴散式生成,訓練方式和生成流程不同。
記住這句就好
先在草圖空間畫,再放大成圖。
實際案例
文字生圖 系統先把文字條件轉成潛在表示,再逐步去雜訊生成高品質圖片。
圖片編輯 做修圖或局部重繪時,LDM 可以在潛在空間裡調整內容,再還原成影像。
算法與應用
LDM 通常結合自編碼器和擴散過程,把高維像素壓到較小的 latent space,再在那裡做生成。這麼做能大幅降計算量,也讓高解析度生成更可行。
中英對照與常見說法
| 說法 | 出現場合 |
|---|---|
| 潛在擴散模型 | 台灣正式用語 |
| 潜在扩散模型 | 簡體寫法 |
| Latent Diffusion Model | 英文原名 |
| LDM | 標準縮寫 |
| 潛空間擴散 | 常見變體 |
關鍵改動:把擴散搬到潛空間
一般的擴散模型直接在像素上加噪與去噪。一張 512×512 的彩色圖有將近 79 萬個數值,每一步去噪都要在這個維度上算,幾十步下來成本極高。
LDM 的做法是加一個自編碼器:
第一步,用編碼器把影像壓縮到低維的潛空間。壓縮倍率常見是 8 倍,512×512 會變成 64×64,數值量降到約六十四分之一。
第二步,擴散的加噪與去噪全部在這個 64×64 的潛空間裡進行。
第三步,去噪完成後,用解碼器把潛向量還原成影像。
這個改動讓消費級顯示卡也跑得動高解析度生成,Stable Diffusion 就是建立在這個架構上。
代價是自編碼器的重建品質變成上限。潛空間丟掉的細節(極細的紋理、小字)解碼器補不回來,這是文字生成在影像裡常常糊掉的原因之一。
文字怎麼控制生成
文字條件透過交叉注意力(cross-attention) 注入去噪網路。文字先過一個文字編碼器(CLIP 的文字塔或 T5)轉成向量序列,去噪網路的每個區塊裡,影像特徵當 query、文字特徵當 key 與 value,讓每個位置都能參照提示詞。
無分類器導引(Classifier-Free Guidance, CFG) 是控制「多聽話」的旋鈕。做法是同一步同時算一次有提示與一次無提示的預測,再把兩者的差放大。CFG 值調高,畫面更貼近提示但多樣性下降、容易過飽和;調低則更自由但可能偏離需求。
取樣器(sampler)決定去噪的步數與路徑。 DDIM、DPM-Solver 這類方法能在二十步左右得到不錯的結果,比原始 DDPM 的上千步快得多。步數不是越多越好,超過一定數量之後畫面幾乎不再變化,只是白花時間。
情境判斷
Q1(直覺題): 如果你現在遇到一個 文字生圖 的場景,這個概念會是第一個想到的工具嗎? → 看情況,但如果任務目標和這個概念的用途一致,就很可能是。核心還是先確認你要解決的是分類、分群、壓縮、檢索,還是最佳化。
Q2(判斷題): 如果你把它和 GAN 一起用,結果反而變不穩,通常該怎麼想? → 看情況。先檢查資料分布、特徵定義和模型假設是否相容,很多時候不是概念本身有問題,而是使用條件不對,像距離尺度沒對齊、標註規則不一致,或輸入格式不合。
常見問題
潛在擴散模型 最容易跟 一般擴散模型 混淆嗎?
一般擴散模型直接處理像素,LDM 先在潛在空間裡工作,速度更快。
什麼情況會用到 潛在擴散模型?
你可以把它想成先在草圖上修改,再把草圖放大成成品,省很多計算。 實務上只要你要處理和這個概念相符的任務,就會用到它。
初學者最常錯在哪裡?
GAN 是對抗式生成,LDM 是擴散式生成,訓練方式和生成流程不同。