離線強化學習 是什麼?
Offline Reinforcement Learning:離線強化學習 的完整解釋
從預先收集的固定資料集學習策略,不與環境互動,適合昂貴或危險環境。
核心概念
離線強化學習的核心是處理資料分佈不匹配。標準強化學習算法(Q學習、策略梯度)假設充足的線上交互,智能體能探索整個狀態-行為空間。離線學習中資料集由某個行為策略(behavior policy)生成,可能不覆蓋全部狀態,尤其不覆蓋需要的狀態-行為對。
離策略(off-policy)學習與離線的區別需澄清。離策略是指用舊策略數據學習新策略,但訓練中能持續與環境互動收集新數據。離線是指不與環境互動,只用固定資料集。離線學習通常結合離策略技術,但離策略學習不必是離線。
出分佈問題是離線學習的致命風險。若學到的策略在資料集外的狀態採取行為,環境可能返回極端獎賞(實際不可達的最小獎賞)。Q值估計對此無防守,導致策略優化不存在的狀態-行為對,最終性能崩潰。解決方案是限制策略接近行為策略。
運作原理
離線Q學習直接應用Q學習但限制資料集。貝爾曼更新為Q(s,a) ← Q(s,a) + α[r + γmax(Q(s',a')) - Q(s,a)]。問題在於max(Q(s',a'))可能對分佈外狀態s'過於樂觀,導致過估計。修正方法有二。第一是保守的Q學習(CQL),在目標中加懲罰項,降低未見狀態的Q值:Q(s,a) ← Q(s,a) + α[r + γ(V_min - λCQL(s')) - Q(s,a)]。V_min是最小可能值,CQL項懲罰高Q值,整體導致下界估計而非上界。
第二是約束策略最佳化(CPO、OPPO),限制學習策略接近行為策略。通過KL散度約束或其他發散度測度,確保新策略在資料分佈上的行為與舊策略接近。行為接近時,新策略的性能估計誤差較小。公式如最大化E[A(s,a)]同時約束KL(π_new||π_old) < δ。
Batch Constrained Q-learning(BCQ)更激進,直接排除資料集外行為。在行為選擇時,只考慮生成數據中實際出現過的狀態-行為對。這有效但可能性能受限。
實踐中常用綜合方法。首先用CQL或類似方法訓練保守Q函數。其次加入策略約束防止過度偏離。第三監控價值估計的不確定性,用不確定性指標作為進一步約束。
實際應用
自動駕駛訓練是離線強化學習的典型場景。收集真實駕駛資料(從人類駕駛員或傳感器記錄),無法直接在真實環境訓練極端駕駛(為了學習容錯能力會導致事故)。離線學習從記錄數據學習合理駕駛策略,先在模擬器驗證安全,再轉移到真實車輛。
醫療決策(治療方案選擇)使用離線強化學習。從患者醫療記錄學習最優治療策略,不能在真實患者上試驗危險療法。學到的策略指導臨床決策,改進患者預後。
機器人操作學習中,可能積累大量人類演示和失敗嘗試。離線強化學習從這些演示數據提取最優行為,加速學習曲線,避免重複失敗。
推薦系統常用離線學習。從歷史點擊日誌優化推薦策略,無法直接驗證新策略(發佈前需測試)。離線評估新策略在歷史數據上的性能,選擇有改進潛力的策略後再進行受限上線測試。
能源系統優化(電網負載調度、空調溫度控制)使用離線強化學習。從歷史運行數據學習最優控制策略,避免在生產系統上試驗可能導致停電或不適的極端控制。
常見誤區
許多人認為離線強化學習就是用舊資料訓練。實際上核心挑戰是出分佈問題,簡單應用標準算法往往失敗。保守估計、策略約束等機制是必要的,不是可選的。
另一誤區是認為資料越多越好。資料品質比數量更重要。若資料集完全由次優策略生成,離線學習無法學到更優策略,受上界束縛。資料的多樣性和覆蓋度決定了學習上限。
有人忽視模型不確定性的重要性。標準Q估計不提供置信區間,無法知道估計有多準。帶不確定性估計的方法能更好應對分佈外風險。
與相關技術的比較
- 與在線強化學習的比較:在線方法持續與環境互動,能直接驗證策略效果,調整快速。離線方法固定資料,無法驗證,但適合環境互動成本高的場景。兩者可結合,先離線預訓練再在線微調。
- 與行為複製的比較:行為複製(監督學習預測演示行為)簡單但無法超越數據。離線強化學習利用獎賞信號改進,可超越數據中最優行為,但更複雜。結合兩者(先行為複製預訓練再離線RL微調)效果常最佳。
- 與逆強化學習的比較:逆強化學習從演示推斷獎賞函數,離線強化學習已知獎賞從資料學習。逆強化學習適合難以定義獎賞的任務,離線適合獎賞清晰但無法試驗的任務。
- 與模型學習的比較:學習環境模型後用模型規劃,也能從有限資料改進。模型方法計算複雜但可適應新奬賞,離線RL直接學策略但對獎賞修改無法適應。兩者結合(模型+策略)更強。