自回歸模型 是什麼?

Autoregressive Model:自回歸模型 的完整解釋

依序根據前面所有輸出預測下一個元素的生成式模型架構。

自回歸模型(Autoregressive Model,AR Model)是機器學習與統計領域中一類重要的序列生成模型,其設計理念源自時間序列分析,後被深度學習社群廣泛應用於語言、影像、音訊等多模態內容的生成。

核心數學定義

自回歸模型將序列的聯合機率分解為條件機率的乘積(鏈式法則):

P(x₁, x₂, ..., xT) = P(x₁) × P(x₂|x₁) × P(x₃|x₁,x₂) × ... × P(xT|x₁,...,xT-1)

其中每個 P(xt|x₁,...,xt-1) 就是模型需要學習的條件分布。在生成時,模型從 P(x₁) 採樣出第一個元素,再以此為條件採樣第二個,如此循環直到序列結束。這種「用過去預測現在」的機制就是「自回歸」名稱的由來。

與語言模型的關係

在自然語言處理中,最具代表性的自回歸模型是 GPT 系列(Generative Pre-trained Transformer)。GPT 架構採用 Transformer 解碼器(decoder-only),訓練目標是「下一個詞元預測」(Next Token Prediction):給定前文,最大化正確下一個詞元的對數機率。這個看似簡單的訓練目標在大規模語料與參數下,讓模型學到豐富的語言知識與推理能力。

GPT-2、GPT-3、GPT-4、Claude、Llama、Qwen 等主流大型語言模型都是自回歸模型的典型實例。

自回歸 vs. 非自回歸生成

與自回歸模型相對的是非自回歸模型(Non-Autoregressive Model,NAR),後者嘗試並行生成序列中所有元素,以換取更快的推論速度。然而,由於 NAR 模型打破了序列元素間的依賴關係,生成品質通常不如 AR 模型,在語言生成上的應用較為有限。此外,雙向語言模型如 BERT 採用遮罩語言模型(Masked Language Model)訓練,雖然理解能力強,但不適合用於生成任務,因為它無法逐步向前生成序列。

影像與音訊中的自回歸模型

PixelRNN、PixelCNN(2016,DeepMind):將影像視為像素序列,逐像素預測 RGB 值,是影像生成領域早期的自回歸模型。

WaveNet(2016,DeepMind):以自回歸方式逐樣本生成波形,在語音合成領域取得突破,成為 Google Assistant 的底層技術之一。

VQ-VAE-2 與 DALL-E 1.0(OpenAI):將影像壓縮為離散碼本後,用 Transformer 自回歸地生成碼的序列,再解碼為影像。

VQGAN + GPT:Taming Transformers(2021)結合向量量化與 Transformer,讓大解析度影像生成也可以用自回歸方式完成。

推論速度的挑戰

自回歸模型的主要缺點是推論效率低:由於每個詞元的生成依賴前一步的輸出,序列生成本質上是序列計算,無法充分並行化。對於長文本生成(如生成 1000 個詞元),模型必須進行 1000 次前向傳播,每次都需要存取所有過去詞元的 KV Cache(Key-Value Cache)。

為改善效率,研究社群提出多種方法: 投機解碼(Speculative Decoding):使用小型草稿模型快速生成多個候選詞元,再由大型模型一次性驗證,理論上可將推論速度提升數倍。 連續批次(Continuous Batching):讓不同長度的請求動態共享 GPU 運算資源,提高吞吐量。 KV Cache 量化壓縮:降低 KV Cache 的記憶體佔用,允許更長上下文的推論。 MTP(Multi-Token Prediction):訓練模型一次預測多個未來詞元,兼顧生成品質與速度。

採樣策略

自回歸模型在生成時,對每個位置的條件分布有多種採樣方式,影響輸出的多樣性與品質: 貪心解碼(Greedy Decoding):每步選擇機率最高的詞元,速度快但容易重複。 束搜索(Beam Search):維護多條候選序列,選擇整體機率最高者,常用於機器翻譯。 溫度採樣(Temperature Sampling):調整溫度參數縮放機率分布,溫度低趨於確定性,溫度高增加隨機性。 Top-k / Top-p(Nucleus)採樣:只從機率最高的 k 個詞元或累積機率達 p 的詞元集合中採樣,平衡多樣性與品質。

在 iPAS AI 應用規劃師認證中,自回歸模型是理解大型語言模型運作原理的核心概念,考生需掌握其生成機制、與 BERT 等非生成模型的區別,以及推論效率相關議題。

常見問題