基於模型的強化學習(Model-based Reinforcement Learning)是什麼?

學習環境模型(動態和獎賞),用模型進行規劃而非直接與環境互動的強化學習方法。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Model-based Reinforcement Learning
主題標籤
強化學習、模型訓練、深度學習
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
基於模型的強化學習(Model-based Reinforcement Learning)是什麼? 強化學習模型訓練
術語快查

搜尋意圖: 如果你在找「基於模型的強化學習 是什麼」或「基於模型的強化學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 學習環境模型(動態和獎賞),用模型進行規劃而非直接與環境互動的強化學習方法。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

學習環境模型(動態和獎賞),用模型進行規劃而非直接與環境互動的強化學習方法。

核心概念

基於模型的強化學習的核心是環境動態模型。模型P(s'|s,a)預測狀態轉移,R(s,a)預測獎賞。智能體用實際經驗訓練這些模型,然後用模型進行規劃而非直接策略學習。規劃可用動態規劃(value iteration)、蒙地卡羅樹搜索(MCTS)或軌跡優化(trajectory optimization)等方法。

模型學習通常作為監督學習問題。給定轉移數據(s,a,s'),訓練模型最小化預測誤差。使用神經網路作為模型時,損失函數為L = E[(P_θ(s'|s,a) - s')²]或類似形式。獎賞模型訓練類似。實現簡單,但模型誤差不可避免。

模型誤差的累積是關鍵挑戰。計劃軌跡時,每步預測誤差累積,多步後預測完全不准。例如機器人運動模型誤差1cm/步,10步規劃誤差可達10cm,導致實際執行與規劃偏離。補救方法包括短地平線規劃、魯棒規劃、模型重新校準等。

運作原理

典型流程是:第一階段收集經驗與環境互動,收集轉移數據。第二階段模型訓練,用經驗訓練轉移和獎賞模型。第三階段規劃,利用模型找最優動作序列。第四階段執行,在環境執行規劃動作,收集新經驗,循環。

蒙地卡羅樹搜索(MCTS)是常見規劃方法。從當前狀態開始構建搜索樹,每次迭代選擇有潛力的分支(利用模型模擬),模擬到終止狀態(用終止條件或默認策略),回溯更新路徑上的價值估計。重複後選擇訪問最多的行為。AlphaGo使用MCTS配合價值網路,通過蒙地卡羅樹搜索與模型結合達到超人性能。

軌跡優化(Trajectory Optimization)方法如DDP(Differential Dynamic Programming)和iLQG(Iterative Linear Quadratic Gaussian)使用局部模型線性化,反覆改進控制軌跡。優勢是計算高效,缺點是容易陷入局部最優。

魯棒規劃應對模型誤差,在最壞情況下優化。例如在規劃中假設模型有擾動(adversarial perturbations),找在所有可能擾動下表現最好的策略。這增加計算但得到更魯棒的決策。

模型不確定性估計也重要。用集合方法(多個模型投票)或貝葉斯方法(概率模型)估計預測的不確定性。在不確定區域探索而非盲目規劃,適應性更強。

實際應用

圍棋和象棋的AI(AlphaGo、AlphaZero)使用基於模型的方法。先學習遊戲規則(環境模型),用MCTS規劃未來著法,配合價值網路指導搜索。這比無模型方法更樣本高效,能從有限自玩數據快速達到超人水平。

機器人控制中,學習精確的運動學和動力學模型後,用軌跡優化規劃高效運動。例如機械臂抓取物體,先學習臂的動力學特性,規劃最短時間路徑。相比無模型強化學習,樣本效率高許多倍。

無人機自動導航在已知環境中學習飛行模型,用模型規劃避障路徑。地形未知部分通過實時採感信息更新模型,適應環境變化。

自動駕駛訓練中,可先在模擬器(已知的模型化環境)訓練,再轉移到真實環境。模擬器就是環境的精確或近似模型。模型質量決定轉移效果。

製造業中的過程控制(溫度、壓力、化學反應)使用基於模型的控制。學習過程動態模型後,模型預測控制(MPC)根據動態模型和約束優化控制輸入。

常見誤區

許多人認為模型誤差小就可忽視。實際上即使1%誤差在100步規劃後累積成100%誤差。長地平線問題中模型誤差致命。短地平線或在線重規劃能減輕此問題。

另一誤區是認為完美模型能解決所有問題。即使模型完美,規劃在複雜環境仍是困難(組合爆炸)。模型學習本身也困難,高維狀態空間中學習可靠模型成本高。

有人認為無模型和基於模型是二選一。實際上混合方法常最優,結合模型規劃和無模型策略學習,在訓練效率和魯棒性間平衡。

與相關技術的比較

  • 與無模型強化學習的比較:基於模型樣本高效但規劃成本高、模型誤差累積;無模型樣本低效但魯棒,無模型誤差。互補特性決定了混合方法的價值。
  • 與監督學習的比較:模型學習是監督學習(預測轉移),但目標不同。監督學習最小化預測誤差,基於模型RL最小化規劃誤差(可能需要接受小預測誤差換取更好規劃性能)。
  • 與規劃和搜索的比較:基於模型RL用強化學習訓練模型,規劃和搜索通常假設模型已知。RL結合模型學習和規劃,自適應程度更高。
  • 與轉移學習的比較:轉移學習利用先前任務學到的模型,基於模型RL從頭學習模型。轉移學習能快速初始化模型,縮短訓練時間。先遷移模型再基於模型RL優化常有效。

常見問題

基於模型的強化學習相比無模型方法的主要優勢是什麼?

主要優勢是樣本效率。無模型方法每個環境互動只得到一個獎賞信號,學習慢。基於模型方法用一次互動訓練模型,模型允許多次規劃,從單次經驗提取多個價值估計。例如環境互動一次得到s→s'轉移,無模型只得一個獎賞,模型方法能用模型預測該狀態對後續許多步的影響,信息利用率高得多。在樣本有限的場景(真實機器人、危險環境)優勢明顯。缺點是模型誤差累積,規劃成本高。選擇應基於環境互動成本與計算資源的權衡。

如何應對基於模型強化學習中的模型誤差問題?

應對模型誤差有多個策略。首先短地平線規劃限制誤差累積,只規劃若干步(如10步)而非完整軌跡,定期重規劃適應環境變化。其次魯棒規劃在最壞情況下優化,假設模型有擾動,找最壞情況下最優決策。第三模型不確定性估計,用集合模型或貝葉斯模型提供置信區間,在不確定區域減少信任模型。第四線上重校準,定期用環境新數據校準模型。第五混合無模型方法,用無模型策略梯度微調模型規劃的結果。綜合應用多種方法能顯著減小誤差影響。

蒙地卡羅樹搜索如何與深度學習結合達到超人性能?

AlphaGo和AlphaZero的成功結合了幾個關鍵要素。首先用深度神經網路學習遊戲模型(規則),使得樹搜索能在學習表示上進行。其次用價值網路評估局面,指導搜索優先選擇高價值分支,減少所需搜索深度。第三用策略網路快速預測下一步最可能的著法,減少搜索寬度。四、採用自玩,系統與自己對弈,不斷改進網路和搜索。MCTS的魯棒性結合深度學習的表示能力,使系統既能精確計劃又能學習通用策略。這是目前強化學習性能最優的方法之一。