擴散語言模型 是什麼?

Diffusion Language Models:擴散語言模型 的完整解釋

將擴散模型的去雜訊生成機制應用於文字序列生成的語言模型,透過迭代精化而非自回歸逐步生成文字。

擴散語言模型(Diffusion Language Models,DLMs)是自然語言處理(NLP)領域近年最受矚目的新興生成架構之一。儘管基於 Transformer 的自回歸語言模型(AR-LM)在過去五年主導了語言生成任務,但研究界對其序列化生成機制的固有局限始終存有疑慮,這為擴散模型進入語言領域提供了動機。

一、自回歸語言模型的局限

要理解擴散語言模型的設計動機,需要先了解自回歸模型(Autoregressive Models)的核心局限。自回歸模型在生成時從左至右逐字預測,每個新生成的 Token 只能依賴已生成的前文。這帶來幾個問題:生成速度受限(無法並行生成多個 Token)、一旦生成錯誤的前文就難以糾正(曝光偏差,Exposure Bias)、難以進行全局規劃(模型在生成第一個詞時還不知道後面會寫什麼)、以及文字編輯需要重新生成(因為任何一處修改都可能影響後續序列)。

二、擴散模型的核心機制

擴散模型(Diffusion Models,DMs)最初在圖像生成領域取得突破(代表作:DALL-E 2、Stable Diffusion、Midjourney 底層架構),其核心機制分為兩個過程。前向過程(Forward Process):訓練時,原始資料(影像或文字)被逐步加入高斯雜訊,直至資料在 T 步後完全變成純高斯雜訊。這個過程是固定的數學操作,無需學習。反向過程(Reverse Process / Denoising Process):模型(通常是 U-Net 或 Transformer 架構)學習「去雜訊」的操作:給定第 t 步的帶噪資料,預測第 t-1 步的較少噪聲版本,或直接預測原始乾淨資料。訓練完成後,生成時從純高斯雜訊開始,透過 T 步反向去雜訊得到最終生成結果。

三、文字擴散的核心技術挑戰

將擴散機制應用於文字面臨一個根本挑戰:圖像在連續空間(像素值是連續實數),高斯雜訊可以直接疊加在連續值上;但文字在離散空間(每個 Token 是詞彙表中的整數索引),離散值無法直接加入連續雜訊。

研究界提出了兩條主要解決路徑。連續擴散(Embedding Space Diffusion):先將離散 Token 映射到連續的嵌入向量空間,在嵌入空間進行擴散,生成完成後再將連續嵌入投影回離散 Token。代表性工作包括 Diffusion-LM(Stanford)和 MDLM。離散擴散(Discrete Diffusion):在離散 Token 空間直接設計噪聲過程,例如使用遮罩(Masking)替代高斯雜訊:將部分 Token 替換為 [MASK] 標記,模型學習在給定部分遮罩序列的條件下預測被遮罩的 Token。代表性工作包括 D3PM、Masked Diffusion LM(MDM)、以及 2025 年引發廣泛關注的 Gemini Diffusion 和 Mercury(來自 Inception Labs)。

四、擴散語言模型的獨特優勢

相比自回歸模型,擴散語言模型在幾個維度上展現出潛在優勢。全局一致性:生成過程從整個序列的粗略輪廓開始逐步精化,模型可以在生成早期就規劃整體結構,而非在看不到結尾的情況下逐字生成。靈活編輯:由於生成不是單向的,可以直接對文字特定位置進行填充或修改(類似圖像修補),而不需要重新生成整個序列。並行生成潛力:反向去雜訊過程中多個位置的預測可以並行進行,理論上可以實現比自回歸模型更快的推論速度(每次 Token 生成不需等前一個完成)。

五、當前的挑戰與研究現狀

擴散語言模型目前仍是研究前沿,尚未在所有指標上全面超越自回歸模型。主要挑戰包括:生成質量在長文字任務上仍有差距;多步去雜訊推論延遲(雖然可以透過較小的去雜訊步數加速,但需要訓練專用的少步蒸餾模型);控制條件生成(如對話任務中的指令跟從)的機制設計比自回歸模型更複雜。2025 年 Inception Labs 發布的 Mercury 商業模型展示了擴散語言模型在程式碼生成任務上達到與 GPT-4 級別相當的效果,且推論速度有顯著優勢,標誌著擴散語言模型向實用化的重要進展。

六、與 iPAS 考試的關聯

擴散語言模型在 iPAS 考試中屬於多模態與生成式 AI 的前沿技術範疇。考生需要了解擴散模型在影像生成中的基本原理,以及其延伸到語言生成的動機與挑戰,這是理解生成式 AI 技術演進路線的重要知識背景。

常見問題