馬可夫決策過程 是什麼?

Markov Decision Process:馬可夫決策過程 的完整解釋

馬可夫決策過程(MDP)是一種用於建模決策的數學框架,其中結果部分隨機,部分受決策者控制。它廣泛應用於強化學習。

容易混淆

MDP vs 馬可夫鏈 馬可夫鏈只看狀態轉移,MDP 還加入動作和獎勵。 一個只有變化,一個還有選擇。

MDP vs 強化學習 MDP 是問題建模方式,強化學習是找解的方法。 一個定義世界,一個學著做決定。

最關鍵的區別: MDP 在描述問題,強化學習在學解法。

記住這句就好

有狀態、有動作、有回饋,才是決策問題。

實際案例

機器人走路 機器人每一步的位置是狀態,走哪個方向是動作,撞牆或到達終點就是回饋。

遊戲 AI 遊戲代理每回合都要決定下一步,成功或失敗的分數就是它學習的信號。

算法與應用

MDP 通常包含狀態、動作、轉移機率、獎勵和折扣因子。 它假設下一步只和現在狀態有關,這就是馬可夫性。 許多強化學習演算法,都是在這個框架下找最佳策略。

MDP 的五個要素

任何一個 MDP 都由五個東西定義,寫作 (S, A, P, R, γ)。少了任何一個,問題就不是 MDP。

符號 名稱 意思
S 狀態集合 環境可能處在的所有情況
A 動作集合 在每個狀態下可以做的所有選擇
P 狀態轉移機率 在狀態 s 做動作 a 之後,跑到狀態 s' 的機率
R 獎勵函數 做完這個動作拿到多少分
γ 折扣因子 未來的獎勵要打幾折,介於 0 到 1

用送貨機器人當例子:狀態是它現在在哪一格,動作是往上下左右哪個方向走,轉移機率描述地板打滑導致它走偏的可能性,獎勵是送達加分、撞牆扣分,折扣因子決定它有多在乎長遠的目標。

馬可夫性質為什麼重要

MDP 名字裡的「馬可夫」指的是一個很強的假設:下一步只跟現在的狀態與動作有關,跟你怎麼走到這裡的完全無關。

這個假設看起來很限縮,但它是整套強化學習能運作的前提。有了它,你只需要記住當下狀態,不必記住整段歷史,狀態空間才不會爆炸,價值函數與貝爾曼方程式(Bellman equation)也才成立。

實務上要注意的是:現實問題常常不滿足這個性質。撲克牌你看不到對手的手牌,機器人的感測器有雜訊,這類「看不到完整狀態」的情況屬於部分可觀察 MDP(POMDP),難度高很多。

常見的處理方式是把狀態定義得更寬,例如把最近幾幀畫面疊起來當成一個狀態,讓速度與方向這種必須靠歷史推斷的資訊重新變成當下狀態的一部分。

情境判斷

Q1(直覺題): 你要描述「做一個動作後,環境會怎麼變」這件事,應該用什麼框架?

→ MDP 很適合,因為它本來就包含動作和狀態轉移。

Q2(判斷題): 只要有時間順序的問題,就一定是 MDP 嗎?

→ 不一定,還要有動作和回饋設計,才算完整決策問題。

相關術語

常見問題

MDP 需要什麼元素?

通常要有狀態、動作、轉移機率、獎勵和折扣因子。

MDP 的馬可夫性是什麼?

意思是下一個狀態只跟現在有關,不用看更久以前的歷史。

MDP 為什麼重要?

因為它把決策問題變成可分析、可學習的數學形式。