搜尋意圖: 如果你在找「代理人系統 是什麼」或「代理人系統 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。
TL;DR: 由一個或多個能自主感知環境、做出決策並採取行動以達成目標的 AI 代理人所組成的計算架構。
實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。
下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。
由一個或多個能自主感知環境、做出決策並採取行動以達成目標的 AI 代理人所組成的計算架構。
代理人系統(Agent Systems)是近年來人工智慧應用架構領域發展最迅速的範疇之一。隨著大型語言模型(LLM)推理能力的大幅提升,以 LLM 為核心的代理人系統已從學術概念演變為企業 AI 落地的主流架構,廣泛應用於程式碼生成、資料分析、客服自動化、研究助理等場景。
代理人(Agent)的四個基本特性由計算機科學家 Michael Wooldridge 與 Nicholas Jennings 在 1995 年的經典定義中提出:自主性(Autonomy)指代理人能在不直接受人類指令控制的情況下獨立運作;反應性(Reactivity)指代理人能感知環境變化並做出適時回應;主動性(Proactiveness)指代理人不只回應外部刺激,也能主動規劃並採取行動以達成目標;社交能力(Social Ability)指代理人能與其他代理人或人類溝通協作。
現代基於 LLM 的代理人系統通常由以下幾個核心元件構成。感知層(Perception Layer)負責接收來自環境的輸入,包括用戶指令、工具執行結果、資料庫查詢結果、網頁內容等。記憶系統(Memory System)分為短期記憶(當前對話上下文,通常就是 LLM 的 context window)與長期記憶(外部向量資料庫或結構化儲存,透過 RAG 機制檢索相關資訊)。規劃模組(Planning Module)是代理人的「大腦」,由 LLM 負責將複雜任務分解為可執行的子步驟,常見的規劃框架包括 ReAct(Reasoning + Acting,交替推理與行動)、Chain-of-Thought 與 Tree of Thoughts。工具集(Tool Set)是代理人的「手腳」,包括程式碼執行器、網路搜尋 API、資料庫查詢接口、外部服務 API 等,代理人透過工具呼叫(Tool Use / Function Calling)與外部世界互動。行動層(Action Layer)執行代理人決策後的具體操作。
多代理人系統(Multi-Agent Systems,MAS)在需要同時處理多個異質子任務或需要多角度驗證的場景中具有優勢。常見的多代理人架構模式包括:協調者-執行者模式(Orchestrator-Worker),由一個協調代理人接收高層目標,分配子任務給多個專業化執行代理人並整合結果;辯論模式(Debate/Multi-Perspective),多個代理人針對同一問題從不同角度提出論點並互相批評,最終達成更高品質的結論;流水線模式(Pipeline),代理人形成有向圖,上游代理人的輸出作為下游代理人的輸入,每個節點專注於特定處理步驟。
代理人系統面臨的主要技術挑戰包括:幻覺問題(Hallucination),LLM 在規劃和推理中可能產生不實內容;工具呼叫可靠性,特別是在長任務鏈中錯誤累積(Compounding Errors);上下文視窗限制,長任務超過 LLM 的 context 容量時需要記憶管理策略;安全與可控性,防止代理人執行越權或有害操作(如意外刪除資料庫、洩露敏感資訊);以及多代理人的協調開銷與一致性保證。
評估代理人系統性能的關鍵指標包括任務完成率(Task Completion Rate)、步驟效率(平均完成任務所需的工具呼叫次數)、安全合規率(觸發安全邊界的比例)、以及在 SWE-bench(軟體工程任務)、WebArena(網頁操作任務)等標準基準上的表現。
從架構設計角度,主流的代理人框架包括 LangChain/LangGraph、AutoGen(Microsoft)、CrewAI、Anthropic Claude SDK Agent 等,各自在任務規劃的靈活性、工具整合的便利性與系統可觀測性上有不同取捨。在實務部署中,代理人系統通常搭配完整的可觀測性(Observability)基礎設施,記錄每個步驟的輸入輸出、工具呼叫日誌與 Token 消耗,以便除錯、審計與持續優化。
常見問題
代理人系統(Agent Systems)和一般的 LLM 對話有什麼本質區別?
一般的 LLM 對話是「問答循環」:用戶輸入 → LLM 輸出文字回應 → 對話結束。代理人系統則是「思考-行動-觀察」的多步驟循環(ReAct 框架):LLM 不只輸出文字,還能呼叫外部工具(搜尋網路、執行程式碼、查詢資料庫、傳送 API 請求),將工具返回的結果納入下一步推理,如此反覆直到完成任務。本質區別在於:普通 LLM 對話是無狀態的單輪推理,代理人系統是有狀態的多輪規劃與執行,代理人能主動「做事情」而非只是「說話」。例如,問 LLM「幫我訂明天的機票」只會得到如何訂票的建議;代理人系統則會真正連接訂票 API、填寫資訊、完成預訂動作。
單一代理人和多代理人系統應該怎麼選擇?
選擇取決於任務的複雜度與子任務的獨立性。單一代理人適合:任務邏輯相對線性、子任務之間強度耦合(後一步依賴前一步的結果)、上下文資訊量在單一 context window 可容納的範圍內、對延遲敏感的場景(多代理人協調有額外開銷)。多代理人系統適合:任務可以分解為多個相對獨立的子任務並行處理(如同時搜尋多個資料來源)、需要不同專業領域的知識(如一個代理人負責程式碼、另一個負責資安審查)、需要多角度驗證以提升輸出品質(辯論架構)、以及任務規模超過單一 LLM context 的限制。實務建議是從最簡單的單一代理人設計起步,遇到明確的瓶頸再引入多代理人架構,避免過度設計。
代理人系統在安全性上有哪些主要風險?
代理人系統的安全風險比普通 LLM 應用高出許多,因為代理人能執行真實操作(刪除檔案、傳送郵件、進行 API 呼叫)。主要風險類型包括:提示注入攻擊(Prompt Injection),惡意內容藏在工具返回結果或網頁中,誘騙代理人執行非預期操作;越權操作,代理人規劃錯誤導致執行了超出授權範圍的動作(如刪除生產資料庫);資料洩露,代理人在工具呼叫中意外將敏感資訊傳送到外部服務;以及無限循環或資源耗盡(代理人陷入錯誤重試迴圈消耗大量 API Token 與費用)。緩解措施包括:最小權限原則(Agent 只授予完成任務所需的最低工具權限)、人工審核關卡(High-stakes 操作需人工確認)、沙箱執行環境(程式碼執行在隔離容器中)、以及操作日誌的即時監控與告警。