逆向強化學習 是什麼?
Inverse Reinforcement Learning:逆向強化學習 的完整解釋
從專家演示的行為推斷潛在獎勵函數的強化學習方法。
核心概念
逆向強化學習(IRL)的基本問題陳述是:給定一個馬爾可夫決策過程的狀態轉移與折扣因子,以及專家在該MDP中的最優策略(或軌跡樣本),推斷該專家所優化的獎勵函數。
IRL與標準強化學習形成對稱關係:
- 標準RL:給定獎勵函數,求最優策略。
- IRL:給定最優策略,求獎勵函數。
IRL的關鍵洞察是:多個不同的獎勵函數可能導致相同的最優策略。例如,平原上走向目標點,獎勵函數可以是「距目標越近越好」,也可以是「走直線」,或者這兩者的線性組合。IRL的目標不一定是找到唯一真實獎勵,而是推斷符合專家行為邏輯的合理獎勵。
運作原理
最大邊際求解(Maximum Entropy IRL)
Maximum Entropy IRL由Ziebart提出,是現代IRL的主流方法。核心思想:在所有與觀測軌跡一致的獎勵函數中,選擇熵最大的那個(即對未觀測狀態的預測不確定性最大)。
這透過解決以下最優化問題實現:
max H(π) subject to E[φ(τ)] = E_π[φ(τ)]
其中φ(τ)是軌跡特徵向量,H(π)是策略熵。最大熵原則避免過擬合:假設獎勵只在觀測到的行為上「恰好」正確,對其他狀態的預測不做過度假設。
深度IRL
Deep IRL使用深度神經網路參數化獎勵函數r(s;θ),與判別器結合進行訓練。流程:
- 初始化獎勵函數r(s;θ)與策略π。
- 給定當前獎勵,用RL訓練策略π以最大化累積獎勵。
- 判別器嘗試區分「專家軌跡」與「學習策略的軌跡」。
- 更新獎勵函數使判別器錯誤最小化(對抗訓練)。
- 重複直到收斂。
這種對抗學習框架與GAN類似,獎勵函數扮演生成器角色,判別器推動獎勵持續改進。
行為克隆vs.IRL
行為克隆(Behavioral Cloning)直接用監督學習擬合專家的策略π_expert(a|s),非常簡單但有分布移位問題:訓練時狀態遵循專家軌跡分布,部署時智能體遇到的狀態與訓練分布有偏差,導致錯誤累積。
IRL通過推斷獎勵函數來解決這個問題。一旦推斷出獎勵,可用任意RL算法在新環境中訓練,策略會自動適應新的轉移或初始狀態。
實際應用
自駕車決策學習
觀察人類駕駛員的軌跡(轉向、加減速等),推斷隱含的獎勵函數(如平衡安全、舒適與效率),訓練新的自駕策略。
機器人操控學習
機器人學習複雜的操作(如倒水、整理物件),從演示視頻推斷獎勵信號,該獎勵通常涉及多個目標(任務完成度、效率、安全性)的權衡。
人機協作
推斷人類在團隊任務中的目標與偏好,使AI助手能協調式地輔助人類。
常見誤區
誤區1:認為IRL能恢復「真實獎勵」。實際上IRL恢復的是與觀測行為一致的某個獎勵,不同IRL演算法會得到不同結果。
誤區2:假定專家總是完全理性的。現實中人類行為包含習慣、惰性、甚至隨機探索,這些都不是優化行為。
誤區3:忽視獎勵函數的可解釋性。推斷出高維複雜的獎勵函數可能在形式上符合專家行為,但人類無法理解其邏輯,這限制了應用。
與相關技術的比較
- IRL vs. 行為克隆:IRL推斷獎勵,泛化更好;克隆直接擬合策略,簡單但易發生分布移位。
- IRL vs. 強化學習:IRL需要專家演示數據,RL可從試錯學習,各有適用場景。
- IRL vs. 獎勵塑形(Reward Shaping):獎勵塑形手動設計獎勵,IRL自動推斷;後者更靈活但計算代價更高。