搜尋意圖: 如果你在找「自回歸模型 是什麼」或「自回歸模型 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 依序根據前面所有輸出預測下一個元素的生成式模型架構。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
依序根據前面所有輸出預測下一個元素的生成式模型架構。
自回歸模型(Autoregressive Model,AR Model)是機器學習與統計領域中一類重要的序列生成模型,其設計理念源自時間序列分析,後被深度學習社群廣泛應用於語言、影像、音訊等多模態內容的生成。
核心數學定義
自回歸模型將序列的聯合機率分解為條件機率的乘積(鏈式法則):
P(x₁, x₂, ..., xT) = P(x₁) × P(x₂|x₁) × P(x₃|x₁,x₂) × ... × P(xT|x₁,...,xT-1)
其中每個 P(xt|x₁,...,xt-1) 就是模型需要學習的條件分布。在生成時,模型從 P(x₁) 採樣出第一個元素,再以此為條件採樣第二個,如此循環直到序列結束。這種「用過去預測現在」的機制就是「自回歸」名稱的由來。
與語言模型的關係
在自然語言處理中,最具代表性的自回歸模型是 GPT 系列(Generative Pre-trained Transformer)。GPT 架構採用 Transformer 解碼器(decoder-only),訓練目標是「下一個詞元預測」(Next Token Prediction):給定前文,最大化正確下一個詞元的對數機率。這個看似簡單的訓練目標在大規模語料與參數下,讓模型學到豐富的語言知識與推理能力。
GPT-2、GPT-3、GPT-4、Claude、Llama、Qwen 等主流大型語言模型都是自回歸模型的典型實例。
自回歸 vs. 非自回歸生成
與自回歸模型相對的是非自回歸模型(Non-Autoregressive Model,NAR),後者嘗試並行生成序列中所有元素,以換取更快的推論速度。然而,由於 NAR 模型打破了序列元素間的依賴關係,生成品質通常不如 AR 模型,在語言生成上的應用較為有限。此外,雙向語言模型如 BERT 採用遮罩語言模型(Masked Language Model)訓練,雖然理解能力強,但不適合用於生成任務,因為它無法逐步向前生成序列。
影像與音訊中的自回歸模型
PixelRNN、PixelCNN(2016,DeepMind):將影像視為像素序列,逐像素預測 RGB 值,是影像生成領域早期的自回歸模型。
WaveNet(2016,DeepMind):以自回歸方式逐樣本生成波形,在語音合成領域取得突破,成為 Google Assistant 的底層技術之一。
VQ-VAE-2 與 DALL-E 1.0(OpenAI):將影像壓縮為離散碼本後,用 Transformer 自回歸地生成碼的序列,再解碼為影像。
VQGAN + GPT:Taming Transformers(2021)結合向量量化與 Transformer,讓大解析度影像生成也可以用自回歸方式完成。
推論速度的挑戰
自回歸模型的主要缺點是推論效率低:由於每個詞元的生成依賴前一步的輸出,序列生成本質上是序列計算,無法充分並行化。對於長文本生成(如生成 1000 個詞元),模型必須進行 1000 次前向傳播,每次都需要存取所有過去詞元的 KV Cache(Key-Value Cache)。
為改善效率,研究社群提出多種方法: 投機解碼(Speculative Decoding):使用小型草稿模型快速生成多個候選詞元,再由大型模型一次性驗證,理論上可將推論速度提升數倍。 連續批次(Continuous Batching):讓不同長度的請求動態共享 GPU 運算資源,提高吞吐量。 KV Cache 量化壓縮:降低 KV Cache 的記憶體佔用,允許更長上下文的推論。 MTP(Multi-Token Prediction):訓練模型一次預測多個未來詞元,兼顧生成品質與速度。
採樣策略
自回歸模型在生成時,對每個位置的條件分布有多種採樣方式,影響輸出的多樣性與品質: 貪心解碼(Greedy Decoding):每步選擇機率最高的詞元,速度快但容易重複。 束搜索(Beam Search):維護多條候選序列,選擇整體機率最高者,常用於機器翻譯。 溫度採樣(Temperature Sampling):調整溫度參數縮放機率分布,溫度低趨於確定性,溫度高增加隨機性。 Top-k / Top-p(Nucleus)採樣:只從機率最高的 k 個詞元或累積機率達 p 的詞元集合中採樣,平衡多樣性與品質。
在 iPAS AI 應用規劃師認證中,自回歸模型是理解大型語言模型運作原理的核心概念,考生需掌握其生成機制、與 BERT 等非生成模型的區別,以及推論效率相關議題。
常見問題
自回歸模型為什麼只能從左到右生成,不能修改已生成的內容?
自回歸模型的數學結構決定了它是單向的條件生成:每個位置的輸出依賴前面所有輸出,一旦某個詞元被採樣輸出,後續生成過程就以此為既定條件繼續推進。若要修改已生成的詞元,等同於改變後續所有詞元的條件分布,整個序列必須重新生成。這也是為什麼 LLM 的推論延遲與生成長度成正比:每多生成一個詞元就多做一次前向傳播。部分研究嘗試透過「草稿-驗證」或「擴散語言模型」等架構突破此限制,但在主流應用中自回歸仍是主要範式。
自回歸模型和擴散模型(Diffusion Model)的差別是什麼?
兩者是目前生成式 AI 的兩大主流架構。自回歸模型以序列化的條件預測生成內容,每個步驟輸出一個離散元素(詞元或量化碼),適合語言、程式碼等離散序列的生成,推論步數等於輸出長度。擴散模型則從隨機雜訊開始,透過多步去雜訊(通常數十至數百步)逐漸還原出目標資料,適合影像、音訊、視訊等連續信號的生成,可以並行地修改整個輸出。在語言模型領域自回歸架構仍主導,在影像生成領域擴散模型(如 Stable Diffusion、DALL-E 3 後端)則更為普遍;亦有研究結合兩者優點,如離散擴散語言模型。
溫度參數(Temperature)對自回歸模型的輸出有什麼影響?
溫度參數(Temperature,T)是控制自回歸模型輸出多樣性的關鍵超參數。在採樣前,模型輸出的 logit 會除以 T,再做 softmax 轉為機率。當 T 接近 0 時,機率分布趨向集中於最高機率的詞元,輸出幾乎確定性,適合需要精確答案的任務(如數學計算、程式碼生成);當 T 等於 1 時,使用模型原始分布採樣;當 T 大於 1 時,機率分布趨於平滑,低機率詞元的選取可能性增加,輸出更富創意但可能偏離主題,適合創意寫作等場景。實務上通常在 0.3 至 0.9 之間調整,搭配 Top-p 使用效果更穩定。