離線強化學習(Offline Reinforcement Learning)是什麼?

從預先收集的固定資料集學習策略,不與環境互動,適合昂貴或危險環境。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Offline Reinforcement Learning
主題標籤
強化學習、模型訓練、AI應用
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
離線強化學習(Offline Reinforcement Learning)是什麼? 強化學習模型訓練
術語快查

搜尋意圖: 如果你在找「離線強化學習 是什麼」或「離線強化學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 從預先收集的固定資料集學習策略,不與環境互動,適合昂貴或危險環境。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

從預先收集的固定資料集學習策略,不與環境互動,適合昂貴或危險環境。

核心概念

離線強化學習的核心是處理資料分佈不匹配。標準強化學習算法(Q學習、策略梯度)假設充足的線上交互,智能體能探索整個狀態-行為空間。離線學習中資料集由某個行為策略(behavior policy)生成,可能不覆蓋全部狀態,尤其不覆蓋需要的狀態-行為對。

離策略(off-policy)學習與離線的區別需澄清。離策略是指用舊策略數據學習新策略,但訓練中能持續與環境互動收集新數據。離線是指不與環境互動,只用固定資料集。離線學習通常結合離策略技術,但離策略學習不必是離線。

出分佈問題是離線學習的致命風險。若學到的策略在資料集外的狀態採取行為,環境可能返回極端獎賞(實際不可達的最小獎賞)。Q值估計對此無防守,導致策略優化不存在的狀態-行為對,最終性能崩潰。解決方案是限制策略接近行為策略。

運作原理

離線Q學習直接應用Q學習但限制資料集。貝爾曼更新為Q(s,a) ← Q(s,a) + α[r + γmax(Q(s',a')) - Q(s,a)]。問題在於max(Q(s',a'))可能對分佈外狀態s'過於樂觀,導致過估計。修正方法有二。第一是保守的Q學習(CQL),在目標中加懲罰項,降低未見狀態的Q值:Q(s,a) ← Q(s,a) + α[r + γ(V_min - λCQL(s')) - Q(s,a)]。V_min是最小可能值,CQL項懲罰高Q值,整體導致下界估計而非上界。

第二是約束策略最佳化(CPO、OPPO),限制學習策略接近行為策略。通過KL散度約束或其他發散度測度,確保新策略在資料分佈上的行為與舊策略接近。行為接近時,新策略的性能估計誤差較小。公式如最大化E[A(s,a)]同時約束KL(π_new||π_old) < δ。

Batch Constrained Q-learning(BCQ)更激進,直接排除資料集外行為。在行為選擇時,只考慮生成數據中實際出現過的狀態-行為對。這有效但可能性能受限。

實踐中常用綜合方法。首先用CQL或類似方法訓練保守Q函數。其次加入策略約束防止過度偏離。第三監控價值估計的不確定性,用不確定性指標作為進一步約束。

實際應用

自動駕駛訓練是離線強化學習的典型場景。收集真實駕駛資料(從人類駕駛員或傳感器記錄),無法直接在真實環境訓練極端駕駛(為了學習容錯能力會導致事故)。離線學習從記錄數據學習合理駕駛策略,先在模擬器驗證安全,再轉移到真實車輛。

醫療決策(治療方案選擇)使用離線強化學習。從患者醫療記錄學習最優治療策略,不能在真實患者上試驗危險療法。學到的策略指導臨床決策,改進患者預後。

機器人操作學習中,可能積累大量人類演示和失敗嘗試。離線強化學習從這些演示數據提取最優行為,加速學習曲線,避免重複失敗。

推薦系統常用離線學習。從歷史點擊日誌優化推薦策略,無法直接驗證新策略(發佈前需測試)。離線評估新策略在歷史數據上的性能,選擇有改進潛力的策略後再進行受限上線測試。

能源系統優化(電網負載調度、空調溫度控制)使用離線強化學習。從歷史運行數據學習最優控制策略,避免在生產系統上試驗可能導致停電或不適的極端控制。

常見誤區

許多人認為離線強化學習就是用舊資料訓練。實際上核心挑戰是出分佈問題,簡單應用標準算法往往失敗。保守估計、策略約束等機制是必要的,不是可選的。

另一誤區是認為資料越多越好。資料品質比數量更重要。若資料集完全由次優策略生成,離線學習無法學到更優策略,受上界束縛。資料的多樣性和覆蓋度決定了學習上限。

有人忽視模型不確定性的重要性。標準Q估計不提供置信區間,無法知道估計有多準。帶不確定性估計的方法能更好應對分佈外風險。

與相關技術的比較

  • 與在線強化學習的比較:在線方法持續與環境互動,能直接驗證策略效果,調整快速。離線方法固定資料,無法驗證,但適合環境互動成本高的場景。兩者可結合,先離線預訓練再在線微調。
  • 與行為複製的比較:行為複製(監督學習預測演示行為)簡單但無法超越數據。離線強化學習利用獎賞信號改進,可超越數據中最優行為,但更複雜。結合兩者(先行為複製預訓練再離線RL微調)效果常最佳。
  • 與逆強化學習的比較:逆強化學習從演示推斷獎賞函數,離線強化學習已知獎賞從資料學習。逆強化學習適合難以定義獎賞的任務,離線適合獎賞清晰但無法試驗的任務。
  • 與模型學習的比較:學習環境模型後用模型規劃,也能從有限資料改進。模型方法計算複雜但可適應新奬賞,離線RL直接學策略但對獎賞修改無法適應。兩者結合(模型+策略)更強。

常見問題

離線強化學習中出分佈問題為何危害如此之大?

出分佈問題導致價值過估計和策略崩潰。假設資料集只含狀態A和B的轉移,未含C的轉移。若學到的策略傾向進入C狀態,Q值對C狀態的估計基於線性外插,通常過於樂觀。系統在C狀態採取在訓練集中未見的行為,結果可能極壞但Q值預測很高。智能體被吸引進入,性能崩潰。例如在自動駕駛中,訓練集無極端天氣場景,學到的策略可能在雪地快速轉向(訓練集中無此數據),導致翻車。解決方法是強制策略留在資料分佈內,或對分佈外狀態保守估計。

保守Q學習(CQL)如何防止過估計?

CQL在貝爾曼更新的目標值中加入懲罰項,對非資料狀態的Q值進行下界估計。關鍵修改是從max(Q(s',a'))改為min(E[Q(s',a')] - λ·log(π(a'|s'))),或更直接的形式:Q(s,a) ← Q(s,a) + α[r - λ·log(exp(Q(s,a))/Z) + γV_target(s') - Q(s,a)]。第一項-λ·log(...)懲罰高Q值,鼓勵保守估計。λ控制保守程度,λ大時估計更保守,λ小時接近標準Q學習。這樣在資料集外狀態,Q值被迫低估,不會誘導策略進入。實驗表明CQL有效防止出分佈問題,成為離線RL標準方法。

如何評估離線強化學習策略的性能?

直接在環境測試不可行(成本或安全原因),需使用離線評估方法。常用方法包括:一、重要性採樣(IS),用舊策略數據估計新策略性能,但在長軌跡時方差爆炸;二、帶權重的IS(WIS)減小方差,但引入偏差;三、雙魯棒估計(DR)結合Q值和IS,在兩者平衡;四、模型為基礎評估,學習環境模型用新策略在模擬器評估,模型誤差可能導致評估偏差。實踐中常用多種方法交叉驗證。評估越準確,越能信心做出部署決策。