一句話定義
AI Agent(AI 代理)是一個被配上指令、工具與執行迴圈的 AI,你給它一個目標,它自己決定要做哪些動作、做完再回頭檢查結果。
30 秒看重點
- 是什麼:AI Agent 是一個會自己動手的 AI 個體,不是只會回你一段文字的對話框。
- 為什麼重要:它決定了 AI 從「幫你寫」變成「幫你做」,你的工作流程會被它整段吃掉或整段加速。
- 跟誰相關:想自動化雜事的上班族、要導入系統的工程師,還有正在被推銷 AI 方案的主管。
- 最常見的誤解:以為 agent 是一種更強的模型,其實它是模型加上工具跟迴圈的組合。
- 記住這件事就夠了:你交給它的不只是問題,是權限,權限開多大,出包的規模就多大。
AI Agent 到底是什麼?
AI Agent 指的是一個「拿到目標之後會自己選動作、自己呼叫工具、自己判斷有沒有做完」的 AI 個體。它不是新的模型,是把模型包起來、再給它一雙手的做法。
這個定義聽起來抽象,可是打開各家的程式碼就很具體了。OpenAI Agents SDK 直接把 agent 寫成「配了指令、工具、護欄與 handoff 的 LLM」,Google 的 Agent Development Kit 也把 Agent 這個類別定義成「封裝了指令、工具與行為的 AI 實體」。發現了嗎?兩家大廠的講法幾乎一樣:模型是引擎,agent 是整台車,差別在方向盤、油門跟後照鏡。
生活比喻:你可以想像成請一個有鑰匙的鐘點幫手。一般聊天機器人像客服電話,你問「我家水管漏水怎麼辦」,它講一堆步驟,然後掛掉,水還在漏。AI Agent 是你把鑰匙交給對方,他自己開門進來、自己判斷是哪一段漏、自己去五金行買零件、修完傳一則訊息跟你說好了。方便到不行,可是那把鑰匙也是真的給出去了。
為什麼會有 AI Agent?
AI Agent 的出現,是因為單純會講話的模型缺兩樣東西:一雙手,還有一個不會半路忘記自己在幹嘛的腦袋。
問題一:模型本身碰不到外面的世界。 大型語言模型本質上是在預測下一個字,它沒辦法自己開瀏覽器、寄信、改檔案。你問它今天匯率多少,它只能憑訓練資料猜,猜錯了還講得很有自信。
問題二:多步驟的事情,一次回答做不完。 「幫我把這三家報價整理成表格再寄給老闆」這種事,中間至少要查、要算、要排版、要寄。每一次換手都要人接一下,AI 只負責出一張嘴,你負責當那個跑腿的。
所以做法就變成:把模型放進一個迴圈裡,讓它每一輪都能選一個動作、看到結果、再決定下一步。這個想法最早被寫成論文是 2022 年底 Shunyu Yao 等人的 ReAct(收錄於 ICLR 2023),核心概念就是讓模型把「推理」跟「行動」交錯著跑,而不是想完一次就定生死。現在幾乎所有 agent 框架的骨架都還是這一套。
AI Agent 是怎麼運作的?
拆到最小,AI Agent 就是「想一下、動一下、看結果」這三步一直繞圈,繞到做完或繞到你喊停。
- 想:模型根據目標與目前狀態,決定下一步要做什麼。這一步吐出來的東西你通常看不到,它是給系統讀的決策。
- 動:呼叫工具去執行。可能是搜尋、讀寫檔案、打 API、跑一段程式。Hugging Face 的 smolagents 就有兩種寫法,一種讓模型輸出 JSON 來指定工具,另一種是 CodeAgent 直接讓模型寫 Python 程式碼當動作,官方說法是後者平均少用 30% 的步驟。
- 看:把執行結果塞回模型的視野裡,讓它判斷成功或失敗。smolagents 的迴圈就是一路跑到模型主動呼叫
final_answer才停。
「那它不會一直繞不出來嗎?」會啊,這就是為什麼框架都要做狀態管理跟中斷點。LangGraph 主打的就是「長時間執行、有狀態」的 agent,強調短期工作記憶加長期跨對話記憶、失敗後能從斷點自動接續,還能讓人在中途檢查甚至直接改掉 agent 的狀態。官方列出的使用者包含 Klarna、Replit 與 Elastic。
名詞小教室:這段講的「呼叫工具」就是 tool calling(工具呼叫),而 agent 要接上外部資料與服務,現在多半走 MCP 這套協定。簡單來講,工具呼叫是「伸手」的動作,MCP 是大家講好的插座規格。
AI Agent 跟聊天機器人差在哪?
最好記的分法是:聊天機器人交付的是一段文字,AI Agent 交付的是一個已經改變的狀態。
| 比較項目 | AI Agent(AI 代理) | 聊天機器人 |
|---|---|---|
| 你拿到什麼 | 事情被做完了 | 一段告訴你怎麼做的文字 |
| 誰決定步驟 | 它自己排,可以來回很多輪 | 你問一次,它答一次 |
| 有沒有碰外部系統 | 有,會呼叫工具、讀寫資料 | 通常沒有,只在對話框裡 |
| 出錯的代價 | 錯誤會被真的執行出去 | 你看到不對可以直接忽略 |
| 需要給的權限 | 檔案、帳號、API 金鑰 | 幾乎不用 |
| 我會在什麼情況選它 | 重複、多步驟、規則清楚的雜事 | 需要問意見、要我自己判斷的事 |
從這張表可以看出來,兩者真正的差距在於,誰的錯誤會留下痕跡。聊天機器人講錯話你笑一笑就過了,agent 講錯話它會真的把那封信寄出去。所以我自己的判斷標準很粗暴:這件事做錯了要花幾分鐘收拾?五分鐘以內的丟給 agent,一小時起跳的自己來。
你會在哪些 AI 工具看到 AI Agent?
現在最容易碰到 agent 的地方是開發框架、公司內部自用的平台,還有你的手機。
- OpenAI Agents SDK:把 agent、handoff(轉交給另一個 agent)、guardrail(護欄)、session(自動記住對話)當成四個基本積木,另外附 tracing 讓你回頭看它每一步做了什麼,並宣稱支援 100 種以上的模型。
- Google ADK:
Agent負責單一個體的指令與工具,Workflow才負責把多個 agent 用圖狀流程串起來,兩層分得很乾淨。 - LangGraph:主打長時間執行與持久化記憶,適合那種跑好幾個小時、中間還會有人插手的流程。
- Y Combinator 的 QM:本站 8 月 2 日報過,這是 YC 內部自用後以 MIT 授權開源的多人 agent 平台,安全模式分成三段,Strict 是每個工具呼叫都要人核准、Auto 會先過內容篩檢、Dangerous 則是不篩也不停。
- 手機:7 月我們寫過的 Nubia NaviX Ultra AI Agent 手機 就是讓 AI 直接看著螢幕跨 App 操作。
如果你是工程師,最快的入口其實是你已經在用的 AI 寫程式工具,那些會自己開檔案、自己跑測試、自己改到過的,本來就是 agent 的標準樣貌。
學 AI Agent 最常見的 3 個誤解
- 誤解一:AI Agent 是一種更強的模型 — 真相是同一顆模型,包成對話框就是聊天機器人,包上工具跟迴圈就是 agent。差在外面那層,不是裡面那顆。
- 誤解二:工具給越多越好用 — 真相是剛好相反。本站 5 月報過微軟研究團隊的 DELEGATE-52 測試,主流模型在 20 次來回之後平均損毀 25% 的文件內容,而且給它更多工具,表現平均再掉 6 個百分點。工具是選項,選項越多它越容易選錯 QQ。
- 誤解三:agent 跟 Agentic AI 是同一個詞 — 真相是層級不一樣。AI Agent 是一個具體的個體,Agentic AI 形容的是一整套會自己跑完的系統性質,這個我們在代理式 AI 那篇拆得比較細。
想多了解 AI Agent,從哪開始?
沒有技術背景的話,最有效的入門不是看教學,是拿你手上的 AI 工具開一個小任務給它,然後全程盯著看它從第幾步開始歪。老實講,看它出包一次學到的東西,比讀十篇介紹文還多。
如果你是工程師,建議順序是先讀 ReAct 那篇論文的概念(想跟做交錯,就這麼一句),再挑一個框架把最小範例跑起來,OpenAI Agents SDK 或 Google ADK 都可以。先搞懂迴圈長什麼樣子,再去煩惱要選誰家。
常見問題 FAQ
AI Agent 跟 AI 有什麼關係?
AI Agent 是人工智慧的一種應用形式,不是一種新的 AI 技術。它底下跑的通常還是大型語言模型,差別在於外面多了指令、工具與一個會反覆執行的迴圈,讓模型可以真的去操作外部系統。換句話說,AI 負責判斷,agent 這層負責把判斷變成動作。
為什麼 AI Agent 突然這麼紅?
因為 2025 到 2026 年主流廠商幾乎同時把產品線押在這個方向。OpenAI、Google 都推出了自己的 agent 開發框架,LangGraph 這類專做長時間執行的工具也進了 Klarna、Replit、Elastic 等公司的正式環境,Y Combinator 更在 2026 年 7 月 31 日直接把內部自用的 agent 平台 QM 以 MIT 授權開源。工具鏈成熟了,話題自然就熱起來。
我不是工程師也需要懂 AI Agent 嗎?
如果你會用 AI 工具就需要懂一點。AI Agent 跟聊天機器人最大的差別是它的錯誤會真的被執行出去,寄錯的信收不回來、刪掉的檔案要另外救。知道這件事,你就會在給它權限之前先想一下最壞情況,而不是看到「一鍵自動完成」就直接按下去。
AI Agent 的中文翻譯有沒有統一?
沒有完全統一。繁體中文圈最常見的譯法是「AI 代理」,也有人寫成「AI 代理人」或「智慧代理」,本站採用「AI 代理」並在多數情境保留英文原詞 AI Agent。實務上台灣的技術討論幾乎都直接講英文,中文譯名主要出現在新聞與公文裡。
學會 AI Agent 之後,下一個該學什麼?
建議先補工具呼叫與 MCP,那是 agent 碰到外部世界的必經之路;接著看提示詞注入,那是 agent 目前最現實的資安破口;如果想理解它為什麼會胡說八道,就再回頭看大型語言模型與 AI 幻覺。這幾塊補完,你對 agent 的能力邊界跟風險邊界就都有底了。
延伸閱讀
- Agentic AI 是什麼?代理式 AI 跟 AI Agent 到底差在哪 — 個體與系統的層級差別,這篇拆得最細。
- MCP 是什麼?Anthropic 推的 AI 工具標準 — agent 連上外部工具與資料最常走的那套協定。
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — agent 底下跑的引擎。
- 3 則新聞看懂 AI Agent 戰場換了打法 — Y Combinator 開源 QM 與它那三段安全模式。
- AI 代理真的可靠嗎?4 大趨勢揭開殘酷真相 — 微軟 DELEGATE-52 的實測數字。
參考來源
- OpenAI Agents SDK(官方 GitHub) — agent 的定義(指令、工具、護欄、handoff)、sessions 與 tracing,以及支援 100 種以上模型的說明。
- Google Agent Development Kit(官方 GitHub) —
Agent封裝指令、工具與行為,Workflow負責圖狀流程編排的分工。 - LangGraph(官方 GitHub) — 長時間執行、有狀態 agent 的定位,短期與長期記憶、人工介入與斷點續跑,以及使用者名單。
- smolagents(Hugging Face 官方 GitHub) — CodeAgent 與 ToolCallingAgent 的差別、ReAct 迴圈跑到
final_answer才停,以及少用 30% 步驟的說法。 - ReAct: Synergizing Reasoning and Acting in Language Models(官方程式碼庫) — Shunyu Yao 等人發表於 ICLR 2023,推理與行動交錯執行的原始概念。
整理一下重點:AI Agent 真正給你的不是更聰明的答案,是一個會自己動手的執行者,而它做對做錯都會留下痕跡。
順帶一提,YC 那套 QM 把安全模式做成 Strict、Auto、Dangerous 三段,最省事的那一段直接取名叫 Dangerous(這命名真的很誠實)。當一個工具願意把最方便的選項標成危險,那句話通常不是在開玩笑。
希望這一篇有讓你對 AI Agent 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。