一句話定義
Token(中文多譯為詞元)是 AI 模型把文字切開之後的最小處理單位,也是 AI 服務計費與長度上限的計價基準。
30 秒看重點
- 是什麼:Token 是模型讀文字時的最小單位,不是「字」也不是「詞」,而是由切詞器切出來的片段。
- 為什麼重要:你付給 AI 的每一塊錢、每個模型「記得住多少內容」的上限,都是用 Token 在算的。
- 跟誰相關:用 ChatGPT 訂閱制的一般使用者、串 API 要控成本的工程師、要編 AI 預算的老闆都躲不掉。
- 最常見的誤解:以為一個中文字就是一個 Token、以為 Token 跟加密貨幣的代幣是同一個東西。
- 記住這件事就夠了:字數不等於 Token 數,而輸出的 Token 幾乎一定比輸入貴。
AI 的 Token 到底是什麼?
Token 是 AI 模型把一段文字切開之後的最小處理單位。模型不會像人一樣一個字一個字讀,它得先把文字丟進一個叫 tokenizer(切詞器)的東西,切成一段一段再轉成數字,才餵得進去算。
這個切法不照人的直覺走。以 OpenAI 官方的切詞工具 tiktoken 為例,tiktoken is great! 這句話會被切成六個 Token:t、ikt、oken、 is、 great、!。你會發現「tiktoken」這個字被硬拆成三塊,而空格是黏在後面單字前面的。tiktoken 官方文件也直接寫明,實務上平均一個 Token 大約對應 4 個位元組。
生活比喻:Token 就像夜市滷味。你以為老闆是算你夾了幾樣菜,實際上他是照自己的切法下刀、上秤秤重。同樣一鍋東西,換一個老闆切,重量就跑掉了 — AI 的切詞器也是這樣,換一家模型、換一個版本,同一段話的 Token 數就不一樣。
為什麼 AI 要用 Token,不直接算字數?
因為「字」這個單位對電腦來說太不好用了。
問題一是詞彙表塞不下。如果讓模型記住世界上每一個單字,表會爆炸大,而且只要遇到沒看過的詞就整個當機。BPE(Byte-Pair Encoding,位元組對編碼)這套切法就是來解這個的,最早出自 Rico Sennrich、Barry Haddow 與 Alexandra Birch 在 ACL 2016 發表的論文《Neural Machine Translation of Rare Words with Subword Units》,用來處理機器翻譯裡的罕見字。把字拆成更小的片段,模型就能用看過的零件拼出沒看過的詞。
問題二是不同語言的規則差太多。中文、日文、韓文根本沒有空格可以斷詞。Google 開源的 SentencePiece 乾脆把輸入當成一長串 Unicode 字元直接處理,不需要各語言專屬的前處理工具,這也是為什麼現在的模型能一視同仁地吃各種語言。
Andrej Karpathy 的 minbpe 專案講得更白:「所有現代 LLM(例如 GPT、Llama、Mistral)都用這套演算法來訓練自己的切詞器。」所以 Token 不是哪家廠商發明來收錢的名目,它是模型架構本來就長這樣。
Token 是怎麼算出來的?
三步:切開、查表、算錢。
- 切開:切詞器照訓練好的合併規則把文字切成片段。GPT-2 那代的詞彙表是 50,257 個 Token,到了 GPT-4 的
cl100k_base已經是十萬等級,o200k_base又翻一倍。 - 查表:每個片段對應詞彙表裡一個編號,模型實際看到的是一串數字,不是文字。
- 算錢:把輸入的 Token 數加上模型吐出來的 Token 數,各自乘上不同單價。
名詞小教室:不同模型用不同的切詞表。依 OpenAI Cookbook 的對照,
o200k_base給 GPT-4o 系列用,cl100k_base給 GPT-4、GPT-3.5-turbo 與嵌入模型用,p50k_base是舊的 Codex 世代。這也是為什麼你不能拿 A 模型的 Token 數去估 B 模型的帳單。
那中文一個字到底幾個 Token?照 tiktoken「平均一個 Token 約 4 個位元組」這個官方說法推,UTF-8 編碼下一個中文字佔 3 個位元組、一個英文字母只佔 1 個,所以同樣看起來一樣長的內容,中文吃掉的 Token 通常比英文多。常用字大多還在一個 Token 左右,冷僻字被拆成兩塊以上也很常見。講白了,用中文跟 AI 聊天,帳單本來就比英文吃虧一點 QQ。
AI 的 Token 跟加密貨幣的 Token 差在哪?
完全是兩回事,只是英文剛好同一個字。AI 的 Token 是文字被切開後的計算單位,加密貨幣的 Token 是區塊鏈上代表資產或權利的代幣。
| 比較項目 | AI 的 Token | 加密貨幣的 Token |
|---|---|---|
| 中文常見譯法 | 詞元、權杖 | 代幣 |
| 本質 | 文字切開後的最小處理單位 | 區塊鏈上的資產或權利憑證 |
| 你在哪看到 | API 帳單、上下文上限、模型規格表 | 交易所、錢包、白皮書 |
| 有沒有價格波動 | 沒有,單價由模型廠商公告 | 有,由市場交易決定 |
| 會不會混在一起 | 不會,兩邊的產業幾乎沒交集 | 同上 |
從這張表可以看出來,兩個 Token 唯一的共通點就是拼法。如果你是查 AI 用法卻搜到一堆幣圈文章,關鍵字後面加個「AI」通常就乾淨了。
一百萬個 Token 到底要多少錢?
差距非常大,從不到 0.3 美元到 75 美元都有。以開源專案 LiteLLM 維護的公開價目表為例(單位:美元/每百萬 Token,輸入/輸出):
- GPT-4o:2.5 / 10
- GPT-4o mini:0.15 / 0.6
- Claude Sonnet 4.5:3 / 15
- Claude Opus 4.1:15 / 75
- Gemini 2.5 Flash:0.3 / 2.5
- DeepSeek Chat:0.28 / 0.42
看出規律了嗎?輸出永遠比輸入貴,而且常常貴上好幾倍,因為讓模型生成比讓它讀吃力得多。所以真正燒錢的其實不是你問得多長,是你叫它寫得多長(這點超多人沒注意)。
順帶一提,這個價目最近掉得很兇。OpenAI 7 月 30 日就把 GPT-5.6 Luna 的輸入價從每百萬 Token 1 美元砍到 0.20 美元,官方說法是效率變好了 跟中國模型搶單這件事應該也有關。
Token 還會決定什麼?上下文上限
除了錢,Token 也是「模型一次能記得多少」的單位,這個上限叫上下文視窗(Context Window),簡單來講就是模型的短期記憶容量。同樣照 LiteLLM 的規格表,GPT-4o 的輸入上限是 128,000 個 Token、Claude 系列是 200,000 個、Gemini 2.5 系列則是 1,048,576 個。
「那超過會怎樣?」不會報錯,通常是最舊的內容被擠出去。你聊了兩個小時發現 AI 忘記你一開始交代的規則,多半就是這樣被擠掉的。
學 Token 最常見的 3 個誤解
- 誤解一:一個中文字就是一個 Token — 只能說「常用字大概是」。切詞是照統計出來的合併規則走,不是照字數。
- 誤解二:Token 數等於字數,可以直接換算 — 換算比例會隨模型、隨語言、隨標點符號變動,要精算只能用官方切詞工具實際跑。
- 誤解三:訂閱制沒有 Token 問題 — 訂閱制只是把 Token 藏起來了,額度用完照樣降速或限流。
想多了解 Token,從哪開始?
沒有技術背景的話,先養成一個習慣就好:叫 AI 寫東西之前先講清楚要多長。輸出貴、又佔上下文,這一招同時省錢又省容量。
有技術背景的話,直接去看 OpenAI 的 tiktoken 專案,三行程式就能把任何一段文字跑出實際 Token 數;想弄懂原理就讀 Karpathy 的 minbpe,它連 GPT-4 的切詞結果都能完整重現。
常見問題 FAQ
Token 跟 AI 有什麼關係?
Token 是 AI 語言模型處理文字的最小單位。模型無法直接讀懂文字,必須先由切詞器把文字切成 Token 再轉成數字,因此 Token 同時是模型的運算單位、AI 服務的計費單位,以及模型記憶長度的計算單位。
為什麼 AI 計費要用 Token 而不是字數?
因為模型內部本來就是以 Token 為單位在運算,運算成本跟 Token 數直接成正比,跟人類認知的字數沒有固定關係。用字數計費會讓不同語言、不同標點的實際成本嚴重失真。
我不是工程師也需要懂 Token 嗎?
需要,但只要懂概念就夠。知道輸出比輸入貴,你就會習慣先限制回覆長度;知道上下文有上限,你就能理解為什麼長對話中 AI 會忘記前面講過的事,並主動把重要資訊再貼一次。
Token 的中文翻譯有沒有統一?
沒有完全統一。台灣常見譯法是「詞元」,資安領域的 token 則譯為「權杖」,中國大陸也多用「詞元」。因為台灣實務上直接講英文 Token 的人遠多於講詞元的人,本站一律使用「Token」原文,中譯只在第一次出現時標註。
學會 Token 之後,下一個該學什麼?
建議先看上下文視窗(Context Window),它是用 Token 為單位定義的模型記憶上限;接著看大型語言模型(LLM),了解模型怎麼一個 Token 一個 Token 生成回覆;有餘力再看 AI 幻覺,你會發現生成機制跟亂講話之間是有因果關係的。
延伸閱讀
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — 搞懂模型怎麼一個 Token 一個 Token 生成文字。
- AI 幻覺(Hallucination)是什麼?為什麼 ChatGPT 會一本正經地亂講話 — 逐 Token 生成的機制,跟亂講話之間的關聯。
- AI 五分鐘快報:Claude 越獄、Gemini 進機器人,3 件事一次看懂 — OpenAI 把 GPT-5.6 Luna 每百萬 Token 價格砍掉八成的來龍去脈。
- AI Agent 是什麼?不只回答問題,還會幫你動手把事做完 — Agent 會反覆呼叫模型,Token 消耗量跟一般聊天完全不是同一個等級。
參考來源
- tiktoken(OpenAI 官方 GitHub) — BPE 切詞器定位,以及「平均一個 Token 約對應 4 個位元組」的說明。
- How to count tokens with tiktoken(OpenAI Cookbook) — 各切詞表對應哪些模型,以及
tiktoken is great!切成六個 Token 的實例。 - subword-nmt(Rico Sennrich 官方 GitHub) — BPE 論文《Neural Machine Translation of Rare Words with Subword Units》的作者、發表年份與要解決的罕見字問題。
- minbpe(Andrej Karpathy) — 現代 LLM 皆以 BPE 訓練切詞器的說明,以及 GPT-4 切詞表規模。
- SentencePiece(Google 官方 GitHub) — 中日韓等無空格語言不需語言專屬前處理,直接以 Unicode 序列切詞的做法。
- model_prices_and_context_window.json(LiteLLM) — 各模型每百萬 Token 的輸入/輸出單價與上下文上限數字。
整理一下重點:Token 就是 AI 把文字切開後的計算單位,你的帳單跟模型的記憶上限,真的全部都掛在這個數字上。
希望這一篇有讓你對 Token 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。