大型語言模型對齊(LLM Alignment)是什麼?

讓大型語言模型的行為與人類價值觀、意圖及社會規範一致的技術與方法體系。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
LLM Alignment
主題標籤
AI安全、RLHF、AI倫理
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
大型語言模型對齊(LLM Alignment)是什麼? AI安全RLHF
術語快查

搜尋意圖: 如果你在找「大型語言模型對齊 是什麼」或「大型語言模型對齊 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 讓大型語言模型的行為與人類價值觀、意圖及社會規範一致的技術與方法體系。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

讓大型語言模型的行為與人類價值觀、意圖及社會規範一致的技術與方法體系。

LLM 對齊(LLM Alignment,也稱 AI 對齊,AI Alignment)是人工智慧研究中最核心且最具挑戰性的方向之一,關注的問題可以簡單概括為:如何確保 AI 系統「做正確的事」。隨著大型語言模型能力的快速提升,對齊問題從學術討論轉變為迫切的工程與倫理實踐課題。

對齊問題的起源

對齊問題的理論根源可追溯至諾伯特·維納(Norbert Wiener)1960 年的「魔法師學徒」問題:AI 系統可能嚴格執行了它被要求的目標,但這個目標並非人類真正想要的(目標錯誤指定,Goal Misspecification)。對 LLM 而言,即使模型非常聰明,若它優化的是「表面上聽起來令使用者滿意的答案」而非「真實且有用的答案」,就是一種對齊失敗。對齊研究試圖在技術上縮小「模型被訓練要做什麼」與「人類真正希望模型做什麼」之間的差距。

對齊的三個維度(3H 框架)

Anthropic 提出的 3H 框架是業界廣泛採用的對齊評估標準:

有幫助性(Helpful):模型能真正幫助使用者完成任務,而非敷衍或拒絕所有可能有風險的請求。過度保守的拒絕同樣是對齊失敗的一種形式。

無害性(Harmless):模型不應協助產生有害內容,包含武器製作指南、歧視性言論、個資洩露、欺詐詐騙等。

誠實性(Honest):模型應如實表達不確定性、不應編造事實(幻覺)、不應刻意誤導使用者。

主要技術方法

有監督微調(Supervised Fine-Tuning, SFT):收集人類專家示範的理想回答,讓模型學習模仿。這是對齊的第一步,建立模型行為的基本「對齊感」,但示範資料的品質和覆蓋面有限。

以人類反饋強化學習(RLHF, Reinforcement Learning from Human Feedback):由人類標注員對模型生成的多個回答進行兩兩比較排名,以此訓練獎勵模型(Reward Model),再用 PPO 等強化學習演算法讓語言模型最大化獎勵模型的分數。InstructGPT、ChatGPT、Claude 等主流模型均採用此方法。

可驗證獎勵強化學習(RLVR, RL with Verifiable Rewards):當任務的正確答案可以客觀驗證時(如數學題、程式碼題),以客觀正確性作為獎勵信號,而非依賴人類偏好,可以避免 RLHF 的「過度對人類評分員口味的對齊」問題。DeepSeek-R1 與 OpenAI o1 的訓練包含 RLVR 組件。

直接偏好優化(DPO, Direct Preference Optimization):RLHF 的一種簡化版本,直接從偏好資料中推導出訓練信號而無需顯式訓練獎勵模型,訓練更穩定、成本更低,在開源社群廣泛應用。

憲法 AI(Constitutional AI, CAI):Anthropic 提出的方法,讓模型根據一組預設的原則(「憲法」)對自己的輸出進行自我批評和修訂(RLAIF,以 AI 反饋替代部分人類反饋),減少對大量人工標注的依賴。

對齊稅(Alignment Tax)

對齊訓練有時會帶來「對齊稅」,即對齊後的模型在某些基準測試上表現不如未對齊的基礎模型。這是因為對齊訓練引導模型更謹慎、更偏向拒絕邊界請求,有時也限制了模型在創意或技術性任務上的探索能力。業界的持續挑戰是設計既能保持高能力又能保持良好對齊的訓練方法,現有的主流模型(GPT-4、Claude 3、Gemini)通常認為其對齊稅已可控。

對齊的深層挑戰

規格化困難:人類價值觀難以完整、精確地形式化為機器可優化的目標函數。任何不完整的規格都可能被聰明的模型以意外方式「滿足」(Goodhart's Law:當指標成為目標,它就不再是好指標)。

可擴展性問題:當 AI 能力超越人類在特定領域的判斷能力時,人類標注員可能無法有效評估 AI 輸出的好壞,RLHF 的人類反饋品質就無法保證。這驅動了「可擴展監督」(Scalable Oversight)與「AI 輔助評估」等研究方向。

泛化問題:在訓練分布內對齊的行為未必能泛化到分布外的輸入,導致對齊只在「測試過的情境」下有效,而在真實世界的邊界情境下失效。

對齊 vs. 安全

對齊(Alignment)有時與 AI 安全(AI Safety)混用,但嚴格來說:對齊關注的是 AI 行為是否符合人類意圖(對齊失敗通常導致 AI 有害但非故意);AI 安全更廣泛,還包含 AI 系統的魯棒性(對抗對抗性攻擊)、可靠性(在分布外情境下的穩定表現)、以及長期 AI 存在風險的研究。

在 iPAS AI 應用規劃師認證中,LLM 對齊是 AI 倫理、安全與負責任 AI 部署的核心考核範疇,考生需理解其重要性、主要技術路徑(RLHF、DPO、CAI)以及對齊失敗的典型表現。

常見問題

RLHF 和 DPO 在對齊訓練中各自的優缺點是什麼?

RLHF(人類反饋強化學習)與 DPO(直接偏好優化)都是主流的對齊訓練技術,但工程實作上有明顯差異。RLHF 需要分三個階段:訓練獎勵模型、用 PPO 做強化學習微調、以及人工收集大量偏好資料;其優點是理論上更靈活,可以持續從人類反饋中改進,但訓練不穩定(PPO 超參數敏感)、計算資源需求高(同時需要策略模型、獎勵模型、參考模型),且獎勵模型本身可能被「駭」(reward hacking,模型找到讓獎勵模型打高分但實際不好的輸出)。DPO 直接從偏好對(好回答 vs. 差回答)計算損失函數,無需顯式訓練獎勵模型,訓練更穩定、成本更低、實現更簡單;缺點是靈活性較低,無法即時利用新的人類反饋動態調整。實際開發中,許多開源模型(如 Mistral、Llama 的對齊版本)採用 DPO,商業閉源模型(如 GPT-4、Claude)通常採用 RLHF 或其改進版本。

對齊做得好的模型,有可能過度拒絕請求嗎?

會,這是對齊研究的重要課題,稱為「過度謹慎」(Overcaution)或「過度對齊」。當模型被訓練成對任何可能有風險的關鍵詞都保守拒絕時,它可能無法回答正當的醫學問題、歷史研究、安全教育需求,甚至無法討論普通的小說或電影劇情。這種過度拒絕同樣是對齊失敗的一種形式,因為它降低了模型的有用性(Helpfulness),違背了 3H 框架中的 H1。Anthropic 的研究明確指出「拒絕無害請求和回應有害請求一樣是問題」。改善方向包含:更精細的有害性判斷(區分真實有害意圖與合法需求)、提供更好的使用情境分類訓練資料、以及讓模型在拒絕時提供替代幫助路徑。使用者遇到不合理拒絕時,提供明確的使用情境通常有助於讓模型做出更準確的判斷。

普通企業在部署 LLM 時,需要自己做對齊訓練嗎?

大多數情況下不需要,也不建議。商業 LLM 服務商(Anthropic、OpenAI、Google)已經在基礎模型上做了大量對齊工作,企業直接使用 API 即可獲得已對齊的模型。企業更應聚焦的是「應用層對齊」:透過系統提示詞(System Prompt)明確定義 AI 的角色、能力邊界和禁止行為;設計輸出驗證機制(Output Filtering)攔截不適合的回應;建立人工審核流程(Human-in-the-Loop)處理高風險決策;以及建立持續監控機制,蒐集實際使用中的對齊失敗案例並反饋改進。若企業有特定領域的對齊需求(如醫療行業的特殊倫理規範),可考慮在開源模型基礎上使用 DPO 進行領域特定的對齊微調,成本遠低於從頭訓練。