多智能體強化學習(Multi-agent Reinforcement Learning)是什麼?

多個智能體在同一環境中互動的強化學習,須處理協作、競爭和通訊等複雜關係。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Multi-agent Reinforcement Learning
主題標籤
強化學習、AI基礎、深度學習
考點定位
非 iPAS 核心術語
最後更新
2026/06/22
多智能體強化學習(Multi-agent Reinforcement Learning)是什麼? 強化學習AI基礎
術語快查

搜尋意圖: 如果你在找「多智能體強化學習 是什麼」或「多智能體強化學習 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 多個智能體在同一環境中互動的強化學習,須處理協作、競爭和通訊等複雜關係。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

多個智能體在同一環境中互動的強化學習,須處理協作、競爭和通訊等複雜關係。

核心概念

多智能體強化學習的核心挑戰是環境非穩定性。在單智能體學習中,環境可視為靜態馬可夫決策過程,轉移概率固定。多智能體中,其他智能體的行為改變導致轉移概率隨時間變化。智能體需適應不斷進化的對手或隊友。

Game Theory(博弈論)提供理論框架。零和博弈中,一方利益正好是另一方損失(競爭)。合作博弈中,智能體可協商共同策略。一般和博弈(General-sum games)最複雜,允許雙方同時獲益或損失。納什均衡是關鍵概念:在均衡點,任何智能體單方面改變策略都無法改進收益。

通訊與協調是多智能體的重要方面。無通訊時,智能體只通過觀察他人行為推測意圖,困難重重。有通訊時,智能體能顯式協調策略,協作效率大幅提升。但通訊成本、延遲、不可靠等實際限制需考慮。

運作原理

多智能體環境可形式化為隨機博弈(Stochastic Games)。狀態s由所有智能體觀測的環境決定,每個智能體i選擇行為a_i,環境根據聯合行為(a_1,...,a_n)轉移狀態並發放獎賞r_i。獨立學習者方法中,每個智能體獨立運行強化學習演算法,無通訊。這最簡單但通常無法收斂到納什均衡。

Q學習多智能體擴展存在幾種方法。第一是自私Q學習,每個智能體只優化自己獎賞,忽視他人。缺點是無法保證收斂,環境非穩定導致學習震盪。第二是詢問Q學習,智能體嘗試學習其他智能體的策略模型,據此調整自己策略。複雜但可能收斂。

Actor-Critic多智能體方法中,多個行動者和單個中央評論者協作。評論者觀測所有智能體狀態和行為,提供全局價值估計。每個行動者根據全局反饋優化策略。離散化後簡化為中央訓練分散執行(Centralized Training Decentralized Execution, CTDE)。訓練時可用全局信息,執行時各智能體獨立行動。

通訊與協調方面,智能體可學習發送消息。在協作任務中,通訊幫助協調行為,例如多機器人協作搬運物體。消息可以符號化或連續向量。協作學習使智能體通過反複互動逐步改進通訊協議。

實際應用

多個無人機協作執行任務是經典應用。例如搜救任務中多架無人機需搜索廣大區域,通過多智能體強化學習學習協調路線避免重複搜索,提高搜救效率。智能體透過位置信息隱式協調,或通過無線通訊顯式協調。

RoboCup機器人足球比賽使用多智能體強化學習訓練球隊策略。多個機器人需協作傳球、防守,同時與對方競爭。通過自玩(self-play),機器人球隊逐步改進策略,從簡單傳球進化到複雜戰術。

Dota 2、星際爭霸等複雜遊戲的多人AI訓練使用多智能體強化學習。隊友間需協作,對手間競爭。通過大規模自玩,AI習得戰術協調、經濟管理、地圖控制等複雜策略。OpenAI Five在Dota 2達人類頂級水平,多智能體協作是核心。

交通流優化中,路口信號燈和車輛可視為多智能體系統。信號燈決策影響所有車輛,車輛路線選擇影響後來車輛。通過多智能體強化學習協調全網流量,相比傳統固定信號方案能減少擁堵。

無人車隊編隊行駛使用多智能體強化學習實現安全且高效的隊伍控制。前車決策影響後車安全距離,通過協作學習整個隊伍達到最優速度和間距。

常見誤區

許多人認為多智能體強化學習只需在單智能體演算法上加個迴圈。實際上環境非穩定性帶來根本難度。標準Q學習無法直接適用,需調整收斂條件。不同的架構(分散獨立、中央評論、通訊)適用場景不同。

另一誤區是認為多智能體總能收斂到納什均衡。許多環境多個納什均衡並存,系統可能陷入次優均衡。此外某些學習動力學甚至導致循環而不是收斂。

有人忽視通訊的價值,認為隱式協調足夠。實際上複雜協作任務中,通訊能大幅提升性能。但通訊成本和延遲需權衡。

與相關技術的比較

  • 與單智能體強化學習的比較:多智能體增加環境非穩定性,理論複雜度提升,演算法設計更困難。單智能體方法通常無法直接應用。但多智能體能模擬更現實複雜場景。
  • 與博弈論的比較:多智能體強化學習應用博弈論概念(納什均衡、策略相互作用),但著眼學習(如何找到均衡),博弈論假設理性行為者已知目標。強化學習不知道對手模型,需通過交互學習。
  • 與監督學習的比較:多智能體可視為多任務監督學習,但標籤(獎賞)由互動過程產生,非預先給定。複雜度更高但也更靈活。
  • 與系統控制的比較:多智能體系統可視為分散控制問題。強化學習學習策略,控制論設計最優控制律。前者更適應學習,後者更適應已知模型的精確優化。

常見問題

多智能體強化學習中如何保證收斂?

多智能體環境非穩定,無法保證絕對收斂,只能追求局部收斂性質。常見目標是收斂到納什均衡,但並非所有環境都有純策略均衡。主要方法包括:一、減少智能體數量和行為複雜度,簡化環境;二、引入中央協調者或全局獎賞,降低學習難度;三、使用自玩(self-play),智能體與自己歷代版本對抗,減少環境波動;四、引入通訊機制,智能體顯式協調;五、使用多智能體演算法專用設計,如QMIX、MAPPO,針對多智能體特性優化。完全保證困難,實踐中追求穩定學習曲線和合理性能。

多智能體強化學習中通訊的作用是什麼?

通訊顯著改進協作效率。無通訊時,智能體只通過觀察他人行為推測意圖,推理過程緩慢且易出錯。有通訊時,智能體能直接交換信息協調策略。例如多機器人搜救,無通訊時需推測他人搜索區域,容易重複;有通訊時直接分配區域,效率倍增。通訊可符號化(離散消息如「向北」)或連續(向量表示)。學習什麼通訊是核心研究,系統需自動發現有效的通訊協議。缺點是通訊成本(帶寬、延遲、能耗),實際應用中需權衡。

如何選擇多智能體強化學習的架構?

選擇應考慮任務性質和實際約束。協作任務推薦中央訓練分散執行(CTDE),訓練時全局信息可用加速學習,執行時各智能體獨立減少依賴。競爭或混合任務推薦自玩,系統自動適應對手進化。限制通訊或低通訊環境推薦隱式協調,智能體通過行為推測意圖。允許豐富通訊推薦顯式協調,智能體發送信息。計算資源充足推薦分散學習,各智能體獨立計算;資源限制推薦中央計算。實踐中常混合,例如基礎策略用CTDE快速訓練,細化通過自玩。