一句話定義

AI 推論(Inference)是模型訓練完成之後,拿已經學好的參數去處理新輸入、產生答案的那個階段。

30 秒看重點

  • 是什麼:AI 推論就是模型「上工」的階段,參數不再變動,只負責把你的輸入變成回答。
  • 為什麼重要:訓練是一次性花費,推論是每天每次都要花的錢,長期下來燒的是推論這一塊。
  • 跟誰相關:付 API 帳單的開發者、買晶片的雲端業者,還有每天覺得 AI 回得太慢的一般使用者。
  • 最常見的誤解:很多人把「推論」跟「推理模型會思考」當成同一件事,其實那是兩個完全不同的詞。
  • 記住這件事就夠了:你按下送出到看到字跑出來的那幾秒,全部都叫推論。

AI 推論到底是什麼?

AI 推論是模型訓練完之後,拿已經固定下來的參數去處理新輸入、算出答案的過程。你每一次問 ChatGPT 問題、每一張 AI 生成的圖、每一次 Google 相簿幫你認出人臉,跑的都是推論,模型在這個階段不會再學到任何新東西。

關鍵差別在於「參數會不會被改」。訓練的時候,模型每看一批資料就回頭調整自己的權重,一次又一次地修;推論的時候權重整組凍住,只做一件事,就是把輸入餵進去、把輸出算出來。所以推論吃的算力比訓練小很多,小到 llama.cpp 這種專案可以把模型塞進 MacBook 甚至手機裡跑(官方講的目標就是「在各種硬體上用最少的設定跑 LLM 推論」)。

生活比喻:想像一家手搖飲店。老闆花了三個月試配方,糖水比例調了幾百次才定案,這是訓練,做完就結束了。之後每天中午客人排隊,一杯一杯照配方做出來,這是推論。配方只調一次,但飲料要做一輩子,你猜哪一邊的總成本比較高?

為什麼大家突然都在講 AI 推論?

因為 AI 的成本重心整個從訓練搬到推論了,而且使用者感覺得到的慢跟貴,幾乎都發生在推論這一段。

第一個原因是頻率。 訓練一個模型是一次性的專案,跑完就下班;推論是模型上線後每天、每秒、每個使用者都在跑的事。我們在 8 月報導輝達 Groq 3 LPX 那篇就寫過同一件事:過去講 AI 吃電幾乎都在講訓練,可是訓練是一次性的,推論才是真正會長大的那一塊。

另一個原因比較少人講,是體感。 AI 慢的時候你不會知道它是哪裡慢,但工程師分得很清楚,而且分法還跟直覺相反:慢的通常不是「想」,是「講」。這也是為什麼專攻推論的晶片開始一顆一顆冒出來。

老實講,這個詞會紅其實不是因為技術變了,是因為帳單變了。順帶一提,台灣產業新聞裡的「推論晶片」「推論伺服器」,講的都是這個推論,不是推理小說那個推理。

AI 推論是怎麼運作的?

一次推論拆開來看只有兩個階段:先把你的問題整份讀完,再一個字一個字把答案吐出來。

  1. 讀題(prefill):模型把你輸入的所有 token 一次平行算完,順便把注意力要用的 key 跟 value 存成 KV 快取。這一段是算力密集,決定你等多久才看到第一個字,這個指標叫 TTFT(time to first token),vLLM 的監控指標就直接叫 vllm:time_to_first_token_seconds
  2. 吐字(decode):一次生一個 token,而且每生一個就要把整個 KV 快取重讀一遍。這一段卡的不是算力是記憶體頻寬,簡單來講就是資料在記憶體跟晶片之間搬得夠不夠快。
  3. 停下來:碰到結束符號、碰到你設的長度上限,或碰到上下文視窗塞滿,就收工。

名詞小教室KV 快取是模型把前面算過的注意力結果先存起來,免得每吐一個字就把前文重算一次。省時間,但很吃記憶體。Hugging Face 官方文件舉的例子是 OctoCoder 這個模型在 16,000 token 的序列長度下,快取大約是 80 億個浮點數值、要吃掉 15 GB 記憶體。想看它背後那套機制,可以搭配注意力機制(Attention)是什麼?一起看。

AI 推論跟 AI 訓練差在哪?

一句話:訓練是模型在學,推論是模型在做,兩者用的硬體、算的東西、付錢的方式都不一樣。

比較項目AI 推論(Inference)AI 訓練(Training)
參數會不會變完全凍結,只讀不寫每一批資料都在更新權重
執行頻率每個使用者、每次提問都要跑一次性專案,跑完就結束
主要瓶頸吐字階段卡在記憶體頻寬卡在算力與叢集規模
硬體需求手機、筆電、專用推論晶片都跑得動幾乎只能靠大型 GPU 叢集
誰在付這筆錢你我,按 token 計費,天天付模型公司,開發期一次付

從這張表可以看出來,兩者最大的差別不在技術難度,在時間軸。訓練是資本支出,推論是水電費,而水電費才是會跟著使用者人數一起長大的那個。

你會在哪些地方碰到 AI 推論?

推論藏在每一個你已經在用的 AI 服務背後,只是平常不會用這個詞叫它。

  • ChatGPT、Claude、Gemini 的對話框:你看到字一個一個跳出來,那個「一個一個」就是 decode 階段的真面目,不是介面特效。
  • 本機跑的模型:llama.cpp 支援 1.5 bit 到 8 bit 的整數量化,靠犧牲一點精度把模型壓小,換到能在 Apple Silicon、一般 CPU 上跑推論的能力。
  • 專用推論晶片:輝達的 Groq 3 LPX 就是專攻吐字這一段,Artificial Analysis 在 10 萬 token 長脈絡下實測每秒 3,400 個 token

如果你是工程師,最常碰到推論的地方是省錢工具。vLLM(UC Berkeley 出的推論服務框架)主打 PagedAttention、continuous batching、chunked prefill 這一整套;Anthropic 的 Message Batches API 則是願意等就打對折,官方寫明成本降 50%、多數批次一小時內跑完、超過 24 小時就過期。還有提示詞快取,命中的部分只算基礎輸入價格的 0.1 倍,等於同一份文件重複問十次,後面九次幾乎不用錢(這招真的滿香的)。

講到 AI 推論最常見的 3 個誤解

  1. 誤解一:推論就是 AI 在「推理思考」 — 真相是這兩個詞在英文裡根本不同字。推論是 inference,指模型上線後算答案的階段;推理模型是 reasoning model,指會先產生一段思考過程再回答的那類模型。「那我開思考模式的時候,跑的是推理還是推論?」兩個都是,它先用推論生出一串思考文字,再用推論生出給你看的答案。
  2. 誤解二:推論比訓練便宜,所以不用管 — 真相是單次確實便宜,總量不便宜。訓練跑一次就沒了,推論是每個使用者每天都在跑,量一大整條曲線就翻過來了。
  3. 誤解三:模型有幾 B 參數就準備幾 GB 記憶體 — 真相是要乘上精度。Hugging Face 文件給的粗估是 bfloat16 精度下大約需要「參數量 × 2」GB,所以 Llama-2-70b 要 140 GB,float32 更是要 280 GB;量化到 8 bit 大約砍一半、4 bit 剩 47 GB 左右。而且這還只是權重,KV 快取要另外算 QQ。

想多了解 AI 推論,從哪開始?

沒有技術背景的話,下次用 AI 的時候刻意觀察兩件事:從你按下送出到第一個字出現花了多久(那是 prefill),以及後面字跑出來的速度(那是 decode)。這兩個數字分開看,你對「AI 為什麼卡」的直覺會準很多。

有技術背景的話,直接去翻 vLLM 的官方文件,把 PagedAttention 跟 continuous batching 兩個機制搞懂,這是目前開源推論服務的公版答案。想在自己筆電上玩,llama.cpp 是門檻最低的入口。


常見問題 FAQ

AI 推論跟 AI 訓練有什麼關係?

訓練與推論是同一個模型生命週期的前後兩段。訓練負責讓模型從資料中學會規律並固定下權重,推論則是拿這組已經學好的權重去處理新的輸入。訓練只會做有限的幾次,推論則是模型上線之後每天不斷重複的日常工作。

為什麼 AI 推論突然變成產業焦點?

因為 AI 的成本結構重心從一次性的訓練,轉移到了每天都要付的推論。輝達在 2026 年 8 月宣布專攻推論的 Groq 3 LPX 晶片全面量產,就是這個轉向最直接的訊號。使用者感受得到的等待時間與 API 帳單,也幾乎全部發生在推論階段。

我不是工程師也需要懂 AI 推論嗎?

如果你每天都在用 AI 工具,了解推論會讓你比較容易判斷一件事:AI 回得慢或回得貴,問題出在哪一段。知道慢通常卡在逐字輸出而不是模型在思考,你就會理解為什麼縮短提問、清掉不必要的對話紀錄真的有用。

AI 推論的中文翻譯有沒有統一?

沒有完全統一。台灣產業界與媒體多半把 inference 翻成「推論」,中國則常見「推理」這個譯法。本站一律採用「推論」,理由是「推理」在中文語境已經被 reasoning model(推理模型)佔走了,兩個詞混用會讓讀者分不清楚在講哪一件事。

學會 AI 推論之後,下一個該學什麼?

建議往三個方向延伸:量化(怎麼把模型壓小到能在自己裝置上跑推論)、KV 快取與注意力機制(推論為什麼會卡記憶體),以及上下文視窗(一次推論最多能吃多少內容)。這三個概念合起來,就能解釋大部分「AI 為什麼慢、為什麼貴」的問題。


延伸閱讀


參考來源

  1. vLLM 官方 README|vllm-project — vLLM 的定位(UC Berkeley 出品的推論與服務框架),以及 PagedAttention、continuous batching、chunked prefill、量化與推測解碼等最佳化清單。
  2. LLM inference optimization|Hugging Face Transformers Docs — 「參數量 × 2 GB」的 bfloat16 記憶體估算、Llama-2-70b 的 140/280/47 GB 數字、KV 快取 15 GB 的例子,以及逐字生成卡在記憶體頻寬的說明。
  3. vLLM metrics design doc — TTFT 與逐 token 延遲兩個指標的實際名稱與計算方式。
  4. Batch processing|Claude Platform Docs — 批次推論成本降 50%、多數批次一小時內完成、24 小時未完成即過期的官方說明。
  5. Prompt caching|Claude Platform Docs — 快取命中只算基礎輸入價格 0.1 倍的計價規則。
  6. llama.cpp 官方 README|ggml-org — 在各種硬體上跑 LLM 推論的專案目標,以及 1.5 bit 到 8 bit 整數量化的支援範圍。

整理一下重點:AI 推論真的就是模型「上工」的那一段,訓練只做一次、推論天天在跑,所以現在整個產業的錢跟晶片都往這邊倒。

希望這一篇有讓你對 AI 推論有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。