---
title: "可驗證獎勵強化學習（RLVR (Reinforcement Learning with Verifiable Rewards)）"
slug: rlvr-reinforcement-learning-with-verifiable-rewards
language: zh-TW
source: https://aiterms.tw/learning/what-is-rlvr-reinforcement-learning-with-verifiable-rewards
updated_at: 2026-06-22
tags: [強化學習, 推理模型, 後訓練, DeepSeek, 策略梯度]
ipas_term: false
type: deep-dive
---

# 可驗證獎勵強化學習 是什麼？

> 透過可客觀驗證的獎勵信號（如數學題正確答案）訓練語言模型推理能力的強化學習方法。

RLVR（Reinforcement Learning with Verifiable Rewards，可驗證獎勵強化學習）在 2025 年因為 DeepSeek-R1 的發布而受到廣泛關注，成為當前強推理語言模型（reasoning model）訓練的核心範式之一。

背景：從 RLHF 到 RLVR 的演進
傳統的人類反饋強化學習（RLHF，Reinforcement Learning from Human Feedback）使用人類標注者對模型輸出進行好壞評分，並訓練一個「獎勵模型」（Reward Model）來替代人類評分器。RLHF 的主要局限在於：
1. 人類評分存在主觀性與不一致性，獎勵信號噪音較大。
2. 訓練獎勵模型本身需要大量人工標注，成本高昂。
3. 獎勵模型可能被攻擊（reward hacking），模型學會「討好」獎勵模型而非真正改善能力。

RLVR 透過使用「可程式化驗證的獎勵」規避了上述問題：對於數學題，答案是否正確可由程式碼精確判斷，不需要人類評分，也無法被模型「鑽空子」欺騙。

核心機制
RLVR 通常使用 GRPO（Group Relative Policy Optimization）或 PPO（Proximal Policy Optimization）等策略梯度演算法：
1. 給定一道問題（如數學題），讓模型生成多個回答（包含推理過程和最終答案）。
2. 對每個回答自動驗證最終答案是否正確，正確給正獎勵，錯誤給零或負獎勵。
3. 使用策略梯度更新模型參數，讓模型更傾向於生成能得到正確答案的推理路徑。

可驗證的獎勵類型
- 數學計算：最終數字答案是否正確，可用 sympy 或精確字串比對驗證。
- 程式碼生成：生成的程式能否通過預先設計的測試案例，沙盒執行即可驗證。
- 邏輯謎題：答案的格式與邏輯一致性可程式化驗證。
- 結構化輸出：JSON 格式是否符合 schema，可機器驗證。

思維鏈（Chain-of-Thought）的湧現
RLVR 的一個重要發現是：當使用可驗證獎勵訓練時，模型會自發學習在生成最終答案之前先進行「思考」，寫出類似人類解題過程的推理步驟（chain-of-thought），即使訓練信號只來自最終答案的正確性。DeepSeek-R1 的論文指出，這種推理行為是在 RLVR 訓練過程中「湧現」的，而非透過監督微調直接教給模型的。

獎勵設計的挑戰
- 格式獎勵（Format Reward）：有些 RLVR 實作同時使用答案正確性獎勵與格式獎勵（如要求模型把答案放在特定標籤內），幫助模型穩定輸出格式。
- 稀疏獎勵（Sparse Reward）：獎勵只在最後一步給出，中間的推理步驟沒有直接反饋，這對策略梯度演算法的穩定訓練是挑戰。
- 不可驗證任務：RLVR 只適用於有明確客觀答案的任務，對於開放性問題（如「寫一篇文章」）無法直接應用，仍需依賴 RLHF 或其他方法。

與 SFT 的配合
RLVR 通常在有監督微調（SFT）之後進行，兩者有明確的分工：SFT 用高品質範例教模型正確的輸出格式與基本推理模式；RLVR 進一步強化模型在難題上的探索能力，讓模型學會嘗試不同解題路徑並收斂到正確答案。部分研究（如 DeepSeek-R1-Zero）探索了從基礎模型直接跳過 SFT 進行 RLVR 訓練的可能性。

代表性模型
- DeepSeek-R1 / DeepSeek-R1-Zero（深度求索，2025）
- QwQ（阿里巴巴，2024）
- OpenAI o1 / o3（採用類似的推理訓練範式，具體細節尚未全面公開）

## 常見問題

### RLVR 和 RLHF 的主要差別是什麼？

最核心的差別在於獎勵信號的來源。RLHF 依賴人類標注者對模型輸出進行評分，然後訓練一個獎勵模型替代人類；RLVR 使用可程式化自動驗證的客觀獎勵（如數學答案正確與否），不需要人類評分員。RLHF 的優勢是適用範圍廣（任何有人類偏好的任務）；RLVR 的優勢是獎勵信號精確無噪音、可擴展到大規模訓練，且不存在獎勵模型被攻擊（reward hacking）的問題。目前強推理模型（如 DeepSeek-R1）以 RLVR 訓練數學和程式碼能力，對話品質則仍可能搭配 RLHF。

### RLVR 為什麼能提升模型的推理能力？

RLVR 的本質是給模型一個「探索空間」：面對同一道難題，模型嘗試多種不同的解題路徑，只有能得到正確答案的路徑才獲得正獎勵。透過強化學習不斷迭代，模型逐漸學習到哪些思維模式更有可能得出正確答案，即使是之前監督微調階段從未見過的解題策略也能被探索出來。這與 SFT 的「模仿已知答案」不同，RLVR 允許模型「發現」新的推理策略，這也是為什麼 RLVR 訓練的模型常能在超出訓練分布的難題上表現出色。

### RLVR 只能用在數學和程式碼嗎？其他領域也能用嗎？

目前 RLVR 的應用主要集中在有客觀答案的任務，確實以數學和程式碼為主。但研究社群正在探索將「可驗證性」擴展到更多領域：例如事實問答（答案可用知識庫驗證）、格式化資訊擷取（結構是否符合 schema）、以及某些邏輯推理任務。對於主觀性強的任務（如創意寫作、開放對話），目前較難直接應用 RLVR。一個新興方向是「LLM-as-Judge」結合 RLVR，用另一個強大的 LLM 作為自動驗證器，雖然引入了新的偏見風險，但擴大了 RLVR 的適用範圍。

---

深度解說頁：https://aiterms.tw/learning/what-is-rlvr-reinforcement-learning-with-verifiable-rewards
快查頁：https://aiterms.tw/terms/rlvr-reinforcement-learning-with-verifiable-rewards
最後更新：2026/06/22