搜尋意圖: 如果你在找「逆向強化學習 是什麼」或「逆向強化學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 從專家演示的行為推斷潛在獎勵函數的強化學習方法。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
從專家演示的行為推斷潛在獎勵函數的強化學習方法。
核心概念
逆向強化學習(IRL)的基本問題陳述是:給定一個馬爾可夫決策過程的狀態轉移與折扣因子,以及專家在該MDP中的最優策略(或軌跡樣本),推斷該專家所優化的獎勵函數。
IRL與標準強化學習形成對稱關係:
- 標準RL:給定獎勵函數,求最優策略。
- IRL:給定最優策略,求獎勵函數。
IRL的關鍵洞察是:多個不同的獎勵函數可能導致相同的最優策略。例如,平原上走向目標點,獎勵函數可以是「距目標越近越好」,也可以是「走直線」,或者這兩者的線性組合。IRL的目標不一定是找到唯一真實獎勵,而是推斷符合專家行為邏輯的合理獎勵。
運作原理
最大邊際求解(Maximum Entropy IRL)
Maximum Entropy IRL由Ziebart提出,是現代IRL的主流方法。核心思想:在所有與觀測軌跡一致的獎勵函數中,選擇熵最大的那個(即對未觀測狀態的預測不確定性最大)。
這透過解決以下最優化問題實現:
max H(π) subject to E[φ(τ)] = E_π[φ(τ)]
其中φ(τ)是軌跡特徵向量,H(π)是策略熵。最大熵原則避免過擬合:假設獎勵只在觀測到的行為上「恰好」正確,對其他狀態的預測不做過度假設。
深度IRL
Deep IRL使用深度神經網路參數化獎勵函數r(s;θ),與判別器結合進行訓練。流程:
- 初始化獎勵函數r(s;θ)與策略π。
- 給定當前獎勵,用RL訓練策略π以最大化累積獎勵。
- 判別器嘗試區分「專家軌跡」與「學習策略的軌跡」。
- 更新獎勵函數使判別器錯誤最小化(對抗訓練)。
- 重複直到收斂。
這種對抗學習框架與GAN類似,獎勵函數扮演生成器角色,判別器推動獎勵持續改進。
行為克隆vs.IRL
行為克隆(Behavioral Cloning)直接用監督學習擬合專家的策略π_expert(a|s),非常簡單但有分布移位問題:訓練時狀態遵循專家軌跡分布,部署時智能體遇到的狀態與訓練分布有偏差,導致錯誤累積。
IRL通過推斷獎勵函數來解決這個問題。一旦推斷出獎勵,可用任意RL算法在新環境中訓練,策略會自動適應新的轉移或初始狀態。
實際應用
自駕車決策學習
觀察人類駕駛員的軌跡(轉向、加減速等),推斷隱含的獎勵函數(如平衡安全、舒適與效率),訓練新的自駕策略。
機器人操控學習
機器人學習複雜的操作(如倒水、整理物件),從演示視頻推斷獎勵信號,該獎勵通常涉及多個目標(任務完成度、效率、安全性)的權衡。
人機協作
推斷人類在團隊任務中的目標與偏好,使AI助手能協調式地輔助人類。
常見誤區
誤區1:認為IRL能恢復「真實獎勵」。實際上IRL恢復的是與觀測行為一致的某個獎勵,不同IRL演算法會得到不同結果。
誤區2:假定專家總是完全理性的。現實中人類行為包含習慣、惰性、甚至隨機探索,這些都不是優化行為。
誤區3:忽視獎勵函數的可解釋性。推斷出高維複雜的獎勵函數可能在形式上符合專家行為,但人類無法理解其邏輯,這限制了應用。
與相關技術的比較
- IRL vs. 行為克隆:IRL推斷獎勵,泛化更好;克隆直接擬合策略,簡單但易發生分布移位。
- IRL vs. 強化學習:IRL需要專家演示數據,RL可從試錯學習,各有適用場景。
- IRL vs. 獎勵塑形(Reward Shaping):獎勵塑形手動設計獎勵,IRL自動推斷;後者更靈活但計算代價更高。
常見問題
為什麼不直接用行為克隆,非要推斷獎勵函數?
行為克隆有致命缺陷:分布移位。訓練時狀態遵循專家軌跡的分布,但部署時智能體的狀態分布會偏移(因為模型不完全正確),每個小錯誤累積下去導致大的策略偏差。舉例:學習自駕,訓練資料中大多是正常行駛,偶爾出現緊急制動。若模型在某個微妙差異上出錯,導致偏離正常軌道,它沒學過如何從異常狀態恢復(不在訓練分布中),錯誤就會不可逆轉地惡化。IRL推斷獎勵後,新策略在任何狀態都知道如何最大化獎勵,自動適應分布偏移。
IRL推斷出來的獎勵為什麼會不唯一?
多個獎勵函數可以產生相同的最優策略。簡單例子:走到目標的任務,獎勵可以是「1/距離」、「2/距離」或任何線性放縮。只要獎勵函數保持相同的相對大小關係,最優行為就完全相同。Maximum Entropy IRL透過選擇熵最大的獎勵(對未觀測狀態做最小假設)來處理這個非唯一性,但從原則上講獎勵確實無法完全恢復,只能恢復「與專家行為一致的某個獎勵」。
IRL能處理非理性的專家演示嗎?
標準IRL假定專家是最優決策者,如果專家有習慣性行為、策略性欺騙或決策偏差,IRL會學到錯誤的獎勵。現代研究正在探索Robust IRL,允許一定比例的次優演示,或者學習專家的不完全理性決策過程。但這增加複雜度,目前仍是開放研究方向。在實務中,應該篩選高品質的專家演示,或收集多位不同專家的演示以提高魯棒性。