一句話定義

AI Agent(AI 代理)是一個被配上指令、工具與執行迴圈的 AI,你給它一個目標,它自己決定要做哪些動作、做完再回頭檢查結果。

30 秒看重點

  • 是什麼:AI Agent 是一個會自己動手的 AI 個體,不是只會回你一段文字的對話框。
  • 為什麼重要:它決定了 AI 從「幫你寫」變成「幫你做」,你的工作流程會被它整段吃掉或整段加速。
  • 跟誰相關:想自動化雜事的上班族、要導入系統的工程師,還有正在被推銷 AI 方案的主管。
  • 最常見的誤解:以為 agent 是一種更強的模型,其實它是模型加上工具跟迴圈的組合。
  • 記住這件事就夠了:你交給它的不只是問題,是權限,權限開多大,出包的規模就多大。

AI Agent 到底是什麼?

AI Agent 指的是一個「拿到目標之後會自己選動作、自己呼叫工具、自己判斷有沒有做完」的 AI 個體。它不是新的模型,是把模型包起來、再給它一雙手的做法。

這個定義聽起來抽象,可是打開各家的程式碼就很具體了。OpenAI Agents SDK 直接把 agent 寫成「配了指令、工具、護欄與 handoff 的 LLM」,Google 的 Agent Development Kit 也把 Agent 這個類別定義成「封裝了指令、工具與行為的 AI 實體」。發現了嗎?兩家大廠的講法幾乎一樣:模型是引擎,agent 是整台車,差別在方向盤、油門跟後照鏡。

生活比喻:你可以想像成請一個有鑰匙的鐘點幫手。一般聊天機器人像客服電話,你問「我家水管漏水怎麼辦」,它講一堆步驟,然後掛掉,水還在漏。AI Agent 是你把鑰匙交給對方,他自己開門進來、自己判斷是哪一段漏、自己去五金行買零件、修完傳一則訊息跟你說好了。方便到不行,可是那把鑰匙也是真的給出去了。

為什麼會有 AI Agent?

AI Agent 的出現,是因為單純會講話的模型缺兩樣東西:一雙手,還有一個不會半路忘記自己在幹嘛的腦袋。

問題一:模型本身碰不到外面的世界。 大型語言模型本質上是在預測下一個字,它沒辦法自己開瀏覽器、寄信、改檔案。你問它今天匯率多少,它只能憑訓練資料猜,猜錯了還講得很有自信。

問題二:多步驟的事情,一次回答做不完。 「幫我把這三家報價整理成表格再寄給老闆」這種事,中間至少要查、要算、要排版、要寄。每一次換手都要人接一下,AI 只負責出一張嘴,你負責當那個跑腿的。

所以做法就變成:把模型放進一個迴圈裡,讓它每一輪都能選一個動作、看到結果、再決定下一步。這個想法最早被寫成論文是 2022 年底 Shunyu Yao 等人的 ReAct(收錄於 ICLR 2023),核心概念就是讓模型把「推理」跟「行動」交錯著跑,而不是想完一次就定生死。現在幾乎所有 agent 框架的骨架都還是這一套。

AI Agent 是怎麼運作的?

拆到最小,AI Agent 就是「想一下、動一下、看結果」這三步一直繞圈,繞到做完或繞到你喊停。

  1. :模型根據目標與目前狀態,決定下一步要做什麼。這一步吐出來的東西你通常看不到,它是給系統讀的決策。
  2. :呼叫工具去執行。可能是搜尋、讀寫檔案、打 API、跑一段程式。Hugging Face 的 smolagents 就有兩種寫法,一種讓模型輸出 JSON 來指定工具,另一種是 CodeAgent 直接讓模型寫 Python 程式碼當動作,官方說法是後者平均少用 30% 的步驟。
  3. :把執行結果塞回模型的視野裡,讓它判斷成功或失敗。smolagents 的迴圈就是一路跑到模型主動呼叫 final_answer 才停。

「那它不會一直繞不出來嗎?」會啊,這就是為什麼框架都要做狀態管理跟中斷點。LangGraph 主打的就是「長時間執行、有狀態」的 agent,強調短期工作記憶加長期跨對話記憶、失敗後能從斷點自動接續,還能讓人在中途檢查甚至直接改掉 agent 的狀態。官方列出的使用者包含 Klarna、Replit 與 Elastic。

名詞小教室:這段講的「呼叫工具」就是 tool calling(工具呼叫),而 agent 要接上外部資料與服務,現在多半走 MCP 這套協定。簡單來講,工具呼叫是「伸手」的動作,MCP 是大家講好的插座規格。

AI Agent 跟聊天機器人差在哪?

最好記的分法是:聊天機器人交付的是一段文字,AI Agent 交付的是一個已經改變的狀態。

比較項目AI Agent(AI 代理)聊天機器人
你拿到什麼事情被做完了一段告訴你怎麼做的文字
誰決定步驟它自己排,可以來回很多輪你問一次,它答一次
有沒有碰外部系統有,會呼叫工具、讀寫資料通常沒有,只在對話框裡
出錯的代價錯誤會被真的執行出去你看到不對可以直接忽略
需要給的權限檔案、帳號、API 金鑰幾乎不用
我會在什麼情況選它重複、多步驟、規則清楚的雜事需要問意見、要我自己判斷的事

從這張表可以看出來,兩者真正的差距在於,誰的錯誤會留下痕跡。聊天機器人講錯話你笑一笑就過了,agent 講錯話它會真的把那封信寄出去。所以我自己的判斷標準很粗暴:這件事做錯了要花幾分鐘收拾?五分鐘以內的丟給 agent,一小時起跳的自己來。

你會在哪些 AI 工具看到 AI Agent?

現在最容易碰到 agent 的地方是開發框架、公司內部自用的平台,還有你的手機。

  • OpenAI Agents SDK:把 agent、handoff(轉交給另一個 agent)、guardrail(護欄)、session(自動記住對話)當成四個基本積木,另外附 tracing 讓你回頭看它每一步做了什麼,並宣稱支援 100 種以上的模型。
  • Google ADKAgent 負責單一個體的指令與工具,Workflow 才負責把多個 agent 用圖狀流程串起來,兩層分得很乾淨。
  • LangGraph:主打長時間執行與持久化記憶,適合那種跑好幾個小時、中間還會有人插手的流程。
  • Y Combinator 的 QM:本站 8 月 2 日報過,這是 YC 內部自用後以 MIT 授權開源的多人 agent 平台,安全模式分成三段,Strict 是每個工具呼叫都要人核准、Auto 會先過內容篩檢、Dangerous 則是不篩也不停。
  • 手機:7 月我們寫過的 Nubia NaviX Ultra AI Agent 手機 就是讓 AI 直接看著螢幕跨 App 操作。

如果你是工程師,最快的入口其實是你已經在用的 AI 寫程式工具,那些會自己開檔案、自己跑測試、自己改到過的,本來就是 agent 的標準樣貌。

學 AI Agent 最常見的 3 個誤解

  1. 誤解一:AI Agent 是一種更強的模型 — 真相是同一顆模型,包成對話框就是聊天機器人,包上工具跟迴圈就是 agent。差在外面那層,不是裡面那顆。
  2. 誤解二:工具給越多越好用 — 真相是剛好相反。本站 5 月報過微軟研究團隊的 DELEGATE-52 測試,主流模型在 20 次來回之後平均損毀 25% 的文件內容,而且給它更多工具,表現平均再掉 6 個百分點。工具是選項,選項越多它越容易選錯 QQ。
  3. 誤解三:agent 跟 Agentic AI 是同一個詞 — 真相是層級不一樣。AI Agent 是一個具體的個體,Agentic AI 形容的是一整套會自己跑完的系統性質,這個我們在代理式 AI 那篇拆得比較細。

想多了解 AI Agent,從哪開始?

沒有技術背景的話,最有效的入門不是看教學,是拿你手上的 AI 工具開一個小任務給它,然後全程盯著看它從第幾步開始歪。老實講,看它出包一次學到的東西,比讀十篇介紹文還多。

如果你是工程師,建議順序是先讀 ReAct 那篇論文的概念(想跟做交錯,就這麼一句),再挑一個框架把最小範例跑起來,OpenAI Agents SDK 或 Google ADK 都可以。先搞懂迴圈長什麼樣子,再去煩惱要選誰家。


常見問題 FAQ

AI Agent 跟 AI 有什麼關係?

AI Agent 是人工智慧的一種應用形式,不是一種新的 AI 技術。它底下跑的通常還是大型語言模型,差別在於外面多了指令、工具與一個會反覆執行的迴圈,讓模型可以真的去操作外部系統。換句話說,AI 負責判斷,agent 這層負責把判斷變成動作。

為什麼 AI Agent 突然這麼紅?

因為 2025 到 2026 年主流廠商幾乎同時把產品線押在這個方向。OpenAI、Google 都推出了自己的 agent 開發框架,LangGraph 這類專做長時間執行的工具也進了 Klarna、Replit、Elastic 等公司的正式環境,Y Combinator 更在 2026 年 7 月 31 日直接把內部自用的 agent 平台 QM 以 MIT 授權開源。工具鏈成熟了,話題自然就熱起來。

我不是工程師也需要懂 AI Agent 嗎?

如果你會用 AI 工具就需要懂一點。AI Agent 跟聊天機器人最大的差別是它的錯誤會真的被執行出去,寄錯的信收不回來、刪掉的檔案要另外救。知道這件事,你就會在給它權限之前先想一下最壞情況,而不是看到「一鍵自動完成」就直接按下去。

AI Agent 的中文翻譯有沒有統一?

沒有完全統一。繁體中文圈最常見的譯法是「AI 代理」,也有人寫成「AI 代理人」或「智慧代理」,本站採用「AI 代理」並在多數情境保留英文原詞 AI Agent。實務上台灣的技術討論幾乎都直接講英文,中文譯名主要出現在新聞與公文裡。

學會 AI Agent 之後,下一個該學什麼?

建議先補工具呼叫與 MCP,那是 agent 碰到外部世界的必經之路;接著看提示詞注入,那是 agent 目前最現實的資安破口;如果想理解它為什麼會胡說八道,就再回頭看大型語言模型與 AI 幻覺。這幾塊補完,你對 agent 的能力邊界跟風險邊界就都有底了。


延伸閱讀


參考來源

  1. OpenAI Agents SDK(官方 GitHub) — agent 的定義(指令、工具、護欄、handoff)、sessions 與 tracing,以及支援 100 種以上模型的說明。
  2. Google Agent Development Kit(官方 GitHub)Agent 封裝指令、工具與行為,Workflow 負責圖狀流程編排的分工。
  3. LangGraph(官方 GitHub) — 長時間執行、有狀態 agent 的定位,短期與長期記憶、人工介入與斷點續跑,以及使用者名單。
  4. smolagents(Hugging Face 官方 GitHub) — CodeAgent 與 ToolCallingAgent 的差別、ReAct 迴圈跑到 final_answer 才停,以及少用 30% 步驟的說法。
  5. ReAct: Synergizing Reasoning and Acting in Language Models(官方程式碼庫) — Shunyu Yao 等人發表於 ICLR 2023,推理與行動交錯執行的原始概念。

整理一下重點:AI Agent 真正給你的不是更聰明的答案,是一個會自己動手的執行者,而它做對做錯都會留下痕跡。

順帶一提,YC 那套 QM 把安全模式做成 Strict、Auto、Dangerous 三段,最省事的那一段直接取名叫 Dangerous(這命名真的很誠實)。當一個工具願意把最方便的選項標成危險,那句話通常不是在開玩笑。

希望這一篇有讓你對 AI Agent 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。