可驗證獎勵強化學習 是什麼?

RLVR (Reinforcement Learning with Verifiable Rewards):可驗證獎勵強化學習 的完整解釋

透過可客觀驗證的獎勵信號(如數學題正確答案)訓練語言模型推理能力的強化學習方法。

RLVR(Reinforcement Learning with Verifiable Rewards,可驗證獎勵強化學習)在 2025 年因為 DeepSeek-R1 的發布而受到廣泛關注,成為當前強推理語言模型(reasoning model)訓練的核心範式之一。

背景:從 RLHF 到 RLVR 的演進 傳統的人類反饋強化學習(RLHF,Reinforcement Learning from Human Feedback)使用人類標注者對模型輸出進行好壞評分,並訓練一個「獎勵模型」(Reward Model)來替代人類評分器。RLHF 的主要局限在於:

  1. 人類評分存在主觀性與不一致性,獎勵信號噪音較大。
  2. 訓練獎勵模型本身需要大量人工標注,成本高昂。
  3. 獎勵模型可能被攻擊(reward hacking),模型學會「討好」獎勵模型而非真正改善能力。

RLVR 透過使用「可程式化驗證的獎勵」規避了上述問題:對於數學題,答案是否正確可由程式碼精確判斷,不需要人類評分,也無法被模型「鑽空子」欺騙。

核心機制

RLVR 通常使用 GRPO(Group Relative Policy Optimization)或 PPO(Proximal Policy Optimization)等策略梯度演算法:

  1. 給定一道問題(如數學題),讓模型生成多個回答(包含推理過程和最終答案)。
  2. 對每個回答自動驗證最終答案是否正確,正確給正獎勵,錯誤給零或負獎勵。
  3. 使用策略梯度更新模型參數,讓模型更傾向於生成能得到正確答案的推理路徑。

可驗證的獎勵類型

  • 數學計算:最終數字答案是否正確,可用 sympy 或精確字串比對驗證。
  • 程式碼生成:生成的程式能否通過預先設計的測試案例,沙盒執行即可驗證。
  • 邏輯謎題:答案的格式與邏輯一致性可程式化驗證。
  • 結構化輸出:JSON 格式是否符合 schema,可機器驗證。

思維鏈(Chain-of-Thought)的湧現 RLVR 的一個重要發現是:當使用可驗證獎勵訓練時,模型會自發學習在生成最終答案之前先進行「思考」,寫出類似人類解題過程的推理步驟(chain-of-thought),即使訓練信號只來自最終答案的正確性。DeepSeek-R1 的論文指出,這種推理行為是在 RLVR 訓練過程中「湧現」的,而非透過監督微調直接教給模型的。

獎勵設計的挑戰

  • 格式獎勵(Format Reward):有些 RLVR 實作同時使用答案正確性獎勵與格式獎勵(如要求模型把答案放在特定標籤內),幫助模型穩定輸出格式。
  • 稀疏獎勵(Sparse Reward):獎勵只在最後一步給出,中間的推理步驟沒有直接反饋,這對策略梯度演算法的穩定訓練是挑戰。
  • 不可驗證任務:RLVR 只適用於有明確客觀答案的任務,對於開放性問題(如「寫一篇文章」)無法直接應用,仍需依賴 RLHF 或其他方法。

與 SFT 的配合

RLVR 通常在有監督微調(SFT)之後進行,兩者有明確的分工:SFT 用高品質範例教模型正確的輸出格式與基本推理模式;RLVR 進一步強化模型在難題上的探索能力,讓模型學會嘗試不同解題路徑並收斂到正確答案。部分研究(如 DeepSeek-R1-Zero)探索了從基礎模型直接跳過 SFT 進行 RLVR 訓練的可能性。

代表性模型

  • DeepSeek-R1 / DeepSeek-R1-Zero(深度求索,2025)
  • QwQ(阿里巴巴,2024)
  • OpenAI o1 / o3(採用類似的推理訓練範式,具體細節尚未全面公開)

常見問題