逆向強化學習(Inverse Reinforcement Learning)是什麼?

從專家演示的行為推斷潛在獎勵函數的強化學習方法。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Inverse Reinforcement Learning
主題標籤
強化學習、專家演示、獎勵學習
考點定位
非 iPAS 核心術語
最後更新
2026/07/30
逆向強化學習(Inverse Reinforcement Learning)是什麼? 強化學習專家演示
術語快查

搜尋意圖: 如果你在找「逆向強化學習 是什麼」或「逆向強化學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從專家演示的行為推斷潛在獎勵函數的強化學習方法。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從專家演示的行為推斷潛在獎勵函數的強化學習方法。

核心概念

逆向強化學習(IRL)的基本問題陳述是:給定一個馬爾可夫決策過程的狀態轉移與折扣因子,以及專家在該MDP中的最優策略(或軌跡樣本),推斷該專家所優化的獎勵函數。

IRL與標準強化學習形成對稱關係:

  • 標準RL:給定獎勵函數,求最優策略。
  • IRL:給定最優策略,求獎勵函數。

IRL的關鍵洞察是:多個不同的獎勵函數可能導致相同的最優策略。例如,平原上走向目標點,獎勵函數可以是「距目標越近越好」,也可以是「走直線」,或者這兩者的線性組合。IRL的目標不一定是找到唯一真實獎勵,而是推斷符合專家行為邏輯的合理獎勵。

運作原理

最大邊際求解(Maximum Entropy IRL)

Maximum Entropy IRL由Ziebart提出,是現代IRL的主流方法。核心思想:在所有與觀測軌跡一致的獎勵函數中,選擇熵最大的那個(即對未觀測狀態的預測不確定性最大)。

這透過解決以下最優化問題實現:

max H(π) subject to E[φ(τ)] = E_π[φ(τ)]

其中φ(τ)是軌跡特徵向量,H(π)是策略熵。最大熵原則避免過擬合:假設獎勵只在觀測到的行為上「恰好」正確,對其他狀態的預測不做過度假設。

深度IRL

Deep IRL使用深度神經網路參數化獎勵函數r(s;θ),與判別器結合進行訓練。流程:

  1. 初始化獎勵函數r(s;θ)與策略π。
  2. 給定當前獎勵,用RL訓練策略π以最大化累積獎勵。
  3. 判別器嘗試區分「專家軌跡」與「學習策略的軌跡」。
  4. 更新獎勵函數使判別器錯誤最小化(對抗訓練)。
  5. 重複直到收斂。

這種對抗學習框架與GAN類似,獎勵函數扮演生成器角色,判別器推動獎勵持續改進。

行為克隆vs.IRL

行為克隆(Behavioral Cloning)直接用監督學習擬合專家的策略π_expert(a|s),非常簡單但有分布移位問題:訓練時狀態遵循專家軌跡分布,部署時智能體遇到的狀態與訓練分布有偏差,導致錯誤累積。

IRL通過推斷獎勵函數來解決這個問題。一旦推斷出獎勵,可用任意RL算法在新環境中訓練,策略會自動適應新的轉移或初始狀態。

實際應用

自駕車決策學習

觀察人類駕駛員的軌跡(轉向、加減速等),推斷隱含的獎勵函數(如平衡安全、舒適與效率),訓練新的自駕策略。

機器人操控學習

機器人學習複雜的操作(如倒水、整理物件),從演示視頻推斷獎勵信號,該獎勵通常涉及多個目標(任務完成度、效率、安全性)的權衡。

人機協作

推斷人類在團隊任務中的目標與偏好,使AI助手能協調式地輔助人類。

常見誤區

誤區1:認為IRL能恢復「真實獎勵」。實際上IRL恢復的是與觀測行為一致的某個獎勵,不同IRL演算法會得到不同結果。

誤區2:假定專家總是完全理性的。現實中人類行為包含習慣、惰性、甚至隨機探索,這些都不是優化行為。

誤區3:忽視獎勵函數的可解釋性。推斷出高維複雜的獎勵函數可能在形式上符合專家行為,但人類無法理解其邏輯,這限制了應用。

與相關技術的比較

  • IRL vs. 行為克隆:IRL推斷獎勵,泛化更好;克隆直接擬合策略,簡單但易發生分布移位。
  • IRL vs. 強化學習:IRL需要專家演示數據,RL可從試錯學習,各有適用場景。
  • IRL vs. 獎勵塑形(Reward Shaping):獎勵塑形手動設計獎勵,IRL自動推斷;後者更靈活但計算代價更高。

常見問題

為什麼不直接用行為克隆,非要推斷獎勵函數?

行為克隆有致命缺陷:分布移位。訓練時狀態遵循專家軌跡的分布,但部署時智能體的狀態分布會偏移(因為模型不完全正確),每個小錯誤累積下去導致大的策略偏差。舉例:學習自駕,訓練資料中大多是正常行駛,偶爾出現緊急制動。若模型在某個微妙差異上出錯,導致偏離正常軌道,它沒學過如何從異常狀態恢復(不在訓練分布中),錯誤就會不可逆轉地惡化。IRL推斷獎勵後,新策略在任何狀態都知道如何最大化獎勵,自動適應分布偏移。

IRL推斷出來的獎勵為什麼會不唯一?

多個獎勵函數可以產生相同的最優策略。簡單例子:走到目標的任務,獎勵可以是「1/距離」、「2/距離」或任何線性放縮。只要獎勵函數保持相同的相對大小關係,最優行為就完全相同。Maximum Entropy IRL透過選擇熵最大的獎勵(對未觀測狀態做最小假設)來處理這個非唯一性,但從原則上講獎勵確實無法完全恢復,只能恢復「與專家行為一致的某個獎勵」。

IRL能處理非理性的專家演示嗎?

標準IRL假定專家是最優決策者,如果專家有習慣性行為、策略性欺騙或決策偏差,IRL會學到錯誤的獎勵。現代研究正在探索Robust IRL,允許一定比例的次優演示,或者學習專家的不完全理性決策過程。但這增加複雜度,目前仍是開放研究方向。在實務中,應該篩選高品質的專家演示,或收集多位不同專家的演示以提高魯棒性。