可驗證獎勵強化學習(RLVR (Reinforcement Learning with Verifiable Rewards))是什麼?

透過可客觀驗證的獎勵信號(如數學題正確答案)訓練語言模型推理能力的強化學習方法。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
RLVR (Reinforcement Learning with Verifiable Rewards)
主題標籤
強化學習、推理模型、後訓練
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
可驗證獎勵強化學習(RLVR (Reinforcement Learning with Verifiable Rewards))是什麼? 強化學習推理模型
術語快查

搜尋意圖: 如果你在找「可驗證獎勵強化學習 是什麼」或「可驗證獎勵強化學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 透過可客觀驗證的獎勵信號(如數學題正確答案)訓練語言模型推理能力的強化學習方法。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

透過可客觀驗證的獎勵信號(如數學題正確答案)訓練語言模型推理能力的強化學習方法。

RLVR(Reinforcement Learning with Verifiable Rewards,可驗證獎勵強化學習)在 2025 年因為 DeepSeek-R1 的發布而受到廣泛關注,成為當前強推理語言模型(reasoning model)訓練的核心範式之一。

背景:從 RLHF 到 RLVR 的演進 傳統的人類反饋強化學習(RLHF,Reinforcement Learning from Human Feedback)使用人類標注者對模型輸出進行好壞評分,並訓練一個「獎勵模型」(Reward Model)來替代人類評分器。RLHF 的主要局限在於:

  1. 人類評分存在主觀性與不一致性,獎勵信號噪音較大。
  2. 訓練獎勵模型本身需要大量人工標注,成本高昂。
  3. 獎勵模型可能被攻擊(reward hacking),模型學會「討好」獎勵模型而非真正改善能力。

RLVR 透過使用「可程式化驗證的獎勵」規避了上述問題:對於數學題,答案是否正確可由程式碼精確判斷,不需要人類評分,也無法被模型「鑽空子」欺騙。

核心機制

RLVR 通常使用 GRPO(Group Relative Policy Optimization)或 PPO(Proximal Policy Optimization)等策略梯度演算法:

  1. 給定一道問題(如數學題),讓模型生成多個回答(包含推理過程和最終答案)。
  2. 對每個回答自動驗證最終答案是否正確,正確給正獎勵,錯誤給零或負獎勵。
  3. 使用策略梯度更新模型參數,讓模型更傾向於生成能得到正確答案的推理路徑。

可驗證的獎勵類型

  • 數學計算:最終數字答案是否正確,可用 sympy 或精確字串比對驗證。
  • 程式碼生成:生成的程式能否通過預先設計的測試案例,沙盒執行即可驗證。
  • 邏輯謎題:答案的格式與邏輯一致性可程式化驗證。
  • 結構化輸出:JSON 格式是否符合 schema,可機器驗證。

思維鏈(Chain-of-Thought)的湧現 RLVR 的一個重要發現是:當使用可驗證獎勵訓練時,模型會自發學習在生成最終答案之前先進行「思考」,寫出類似人類解題過程的推理步驟(chain-of-thought),即使訓練信號只來自最終答案的正確性。DeepSeek-R1 的論文指出,這種推理行為是在 RLVR 訓練過程中「湧現」的,而非透過監督微調直接教給模型的。

獎勵設計的挑戰

  • 格式獎勵(Format Reward):有些 RLVR 實作同時使用答案正確性獎勵與格式獎勵(如要求模型把答案放在特定標籤內),幫助模型穩定輸出格式。
  • 稀疏獎勵(Sparse Reward):獎勵只在最後一步給出,中間的推理步驟沒有直接反饋,這對策略梯度演算法的穩定訓練是挑戰。
  • 不可驗證任務:RLVR 只適用於有明確客觀答案的任務,對於開放性問題(如「寫一篇文章」)無法直接應用,仍需依賴 RLHF 或其他方法。

與 SFT 的配合

RLVR 通常在有監督微調(SFT)之後進行,兩者有明確的分工:SFT 用高品質範例教模型正確的輸出格式與基本推理模式;RLVR 進一步強化模型在難題上的探索能力,讓模型學會嘗試不同解題路徑並收斂到正確答案。部分研究(如 DeepSeek-R1-Zero)探索了從基礎模型直接跳過 SFT 進行 RLVR 訓練的可能性。

代表性模型

  • DeepSeek-R1 / DeepSeek-R1-Zero(深度求索,2025)
  • QwQ(阿里巴巴,2024)
  • OpenAI o1 / o3(採用類似的推理訓練範式,具體細節尚未全面公開)

常見問題

RLVR 和 RLHF 的主要差別是什麼?

最核心的差別在於獎勵信號的來源。RLHF 依賴人類標注者對模型輸出進行評分,然後訓練一個獎勵模型替代人類;RLVR 使用可程式化自動驗證的客觀獎勵(如數學答案正確與否),不需要人類評分員。RLHF 的優勢是適用範圍廣(任何有人類偏好的任務);RLVR 的優勢是獎勵信號精確無噪音、可擴展到大規模訓練,且不存在獎勵模型被攻擊(reward hacking)的問題。目前強推理模型(如 DeepSeek-R1)以 RLVR 訓練數學和程式碼能力,對話品質則仍可能搭配 RLHF。

RLVR 為什麼能提升模型的推理能力?

RLVR 的本質是給模型一個「探索空間」:面對同一道難題,模型嘗試多種不同的解題路徑,只有能得到正確答案的路徑才獲得正獎勵。透過強化學習不斷迭代,模型逐漸學習到哪些思維模式更有可能得出正確答案,即使是之前監督微調階段從未見過的解題策略也能被探索出來。這與 SFT 的「模仿已知答案」不同,RLVR 允許模型「發現」新的推理策略,這也是為什麼 RLVR 訓練的模型常能在超出訓練分布的難題上表現出色。

RLVR 只能用在數學和程式碼嗎?其他領域也能用嗎?

目前 RLVR 的應用主要集中在有客觀答案的任務,確實以數學和程式碼為主。但研究社群正在探索將「可驗證性」擴展到更多領域:例如事實問答(答案可用知識庫驗證)、格式化資訊擷取(結構是否符合 schema)、以及某些邏輯推理任務。對於主觀性強的任務(如創意寫作、開放對話),目前較難直接應用 RLVR。一個新興方向是「LLM-as-Judge」結合 RLVR,用另一個強大的 LLM 作為自動驗證器,雖然引入了新的偏見風險,但擴大了 RLVR 的適用範圍。