一句話定義
大型語言模型(LLM)是一種讀過海量文字、靠「預測下一個字」來生成內容的 AI 模型,ChatGPT、Claude、Gemini 都是包在它外面的產品。
30 秒看重點
- 是什麼:LLM 是 Large Language Model 的縮寫,中文叫大型語言模型,一台專門猜下一個字的機器。
- 為什麼重要:你現在用的 AI 聊天、AI 寫程式、AI 摘要,底層幾乎是同一種東西。
- 跟誰相關:每天開 ChatGPT 的上班族、評估導入 AI 的主管,還有被 token 帳單嚇到的工程師。
- 最常見的誤解:以為 LLM 在「查資料」,其實它是在算「下一個字最可能是什麼」。
- 記住這件事就夠了:它不是查到答案才開口,是算得出下一個字就會一直講,所以它會很自信地講錯。
LLM 到底是什麼?
LLM 是大型語言模型(Large Language Model),一種用海量文字訓練出來的 AI 模型,工作內容只有一件事(對,就這麼樸素):看完你給的文字,算出下一個字最可能是什麼,然後一個字一個字接下去。ChatGPT、Claude、Gemini 都是把 LLM 包裝成聊天介面的產品。
你可能會想,「就這樣?那它為什麼看起來這麼聰明?」關鍵在規模。2020 年 5 月 OpenAI 發表 GPT-3 論文〈Language Models are Few-Shot Learners〉,模型有 1,750 億個參數、96 層 Transformer,訓練吃掉約 570GB 文字,據 NVIDIA 技術部落格整理,總共跑了 3,000 億個 token。接龍練到這種量級,文法、常識、程式碼慣例就一起被學進去了。
生活比喻:你可以想像成一個把「文字接龍」練到走火入魔的人。他沒背下每個答案,但讀過的句子多到誇張,所以你講半句,他就能把剩下半句接得像模像樣。厲害的地方在這裡,麻煩的地方也在這裡。
為什麼會有 LLM 這種東西?
LLM 的出現,是因為過去的 AI 只能處理很窄的任務,而 2017 年一篇論文讓「同一個模型什麼文字任務都能做」變成可能。
在那之前,翻譯、摘要、分類各自要訓練一個專用模型,換個任務就得重來一次。2017 年 Google Brain 的 Vaswani 等人在 NeurIPS 發表〈Attention Is All You Need〉,提出 Transformer 架構,完全靠注意力機制運作,把過去必備的遞迴與卷積結構整個拿掉。重點是訓練從此可以大規模平行化,模型才長得到今天的尺寸。
順序是這樣:先有 Transformer,再有人把它餵到很大很大,才有現在講的 LLM。
LLM 是怎麼運作的?
簡單來講就三步:把文字切成 token、算出每個可能接續的機率、挑一個接下去,然後重複。
- 切 token:模型看的不是中文字或英文單字,是 token。依 OpenAI 官方說明,英文大約 4 個字元算 1 個 token,1,000 個 token 約等於 750 個英文單字。
- 算機率:模型把你的整段輸入讀進去,對詞彙表裡每個 token 算出「接在後面的可能性」。
- 接下去:挑一個接上,再把新句子丟回去重算。你看到字逐個冒出來,就是這個迴圈在跑。
名詞小教室:Token(詞元)是 AI 的計價單位,也是它的閱讀單位。你可以想像成計程車的跳表,跳的不是公里數而是文字量,所以各家 API 都用「每百萬 token 多少美元」報價。
LLM 跟 ChatGPT 差在哪?
LLM 是引擎,ChatGPT 是整台車。一個是模型本身,一個是包了介面、記憶、安全機制、付費方案的產品。
| 比較項目 | LLM(大型語言模型) | ChatGPT(AI 聊天產品) |
|---|---|---|
| 本質 | 一組訓練好的模型權重 | 一個網站與 App 服務 |
| 你怎麼碰到它 | 透過 API 或自己下載執行 | 打開瀏覽器就能用 |
| 誰做的 | OpenAI、Anthropic、Google、月之暗面等 | OpenAI 一家 |
| 換掉會怎樣 | 換模型,回答風格與能力全變 | 換產品,介面與帳單全變 |
| 你付的錢買到什麼 | 用量,算 token | 訂閱,算月份 |
從這張表可以看出來,「LLM 是什麼」跟「ChatGPT 是什麼」是兩個層級的問題。同一顆模型可以裝進聊天視窗、程式編輯器,也可以裝進公司內部的客服系統,換的只是外殼。
你會在哪些地方碰到 LLM?
只要會「生成一段文字」的 AI 服務,背後幾乎都有一顆 LLM 在跑。
- ChatGPT / Claude / Gemini:最直接的三個入口,差別在模型個性、上下文長度與定價(
以及你比較忍得住哪一家的月費)。 - 開源模型:像月之暗面的 Kimi K3,2.8 兆參數的完整權重開放下載,等於把引擎丟出來給你自己裝。
- 台灣的 TAIDE:國科會主導的可信任 AI 對話引擎,TAIDE-LX-7B 以 Meta Llama-2-7B 為基底、70 億參數,用約 140GB 繁中語料(中央社與 ETtoday 新聞、教育部辭典等)做持續預訓練、微調與 RLHF,目標是講得出台灣人的中文。
如果你是工程師,碰到它的地方會是 API 金鑰、Hugging Face 上的模型頁,以及每月那張按 token 計費的帳單。
關於 LLM 最常見的 3 個誤解
- 誤解一:LLM 是一個超大的資料庫 — 它存的是機率不是條目。OpenAI 在 2025 年 9 月的論文〈Why Language Models Hallucinate〉指出,現行訓練與評測方式獎勵「有把握地猜」而不是獎勵承認不知道,所以模型寧可掰也不肯說沒把握。
- 誤解二:參數越多一定越好 — 據 Fortune 報導,Sam Altman 早在 2023 年就說過,一味把模型做大的時代差不多結束了。小模型跑得快、便宜、還能塞進自家伺服器,很多情境反而更划算。
- 誤解三:用中文問比較省 token — 剛好相反。BigGo Finance 整理的五大 tokenizer 實測指出,中文在西方模型上要多付一筆「語言稅」,從 GPT-3 時代 p50k_base 的約 182%,到 GPT-4 的 cl100k_base 約 67%,再到 o200k_base 的約 24%,有改善但還沒打平。同樣一段話,中文問就是貴一點 QQ。
想多了解 LLM,從哪開始?
沒有技術背景的話,第一步是拿同一個問題去問 ChatGPT、Claude 跟 Gemini 各一次,你會很直接地感受到「模型不同,答案就不同」,這比讀十篇定義有用多了吧。
有技術背景的話,直接讀 2017 年的〈Attention Is All You Need〉原文,再去 Hugging Face 抓個小模型跑跑看。老實講,跑過一次本機推論,你對「參數」跟「token」的體感會完全不一樣。
常見問題 FAQ
LLM 跟 AI 有什麼關係?
LLM 是人工智慧底下的一個子類別,專門處理文字。AI 還涵蓋影像辨識、語音、推薦系統等技術,LLM 只負責語言的生成與理解。現在大家口中的 AI 熱潮,主要是 LLM 帶起來的。
為什麼 LLM 突然這麼紅?
因為 2017 年的 Transformer 讓模型能大規模平行訓練,2020 年 GPT-3 用 1,750 億參數證明「夠大就會出現新能力」,接著 ChatGPT 把它包成一般人打開就能用的介面。技術鋪了五年,產品化之後才傳遍全世界。
我不是工程師也需要懂 LLM 嗎?
需要,但懂到「它在猜下一個字」這個程度就夠了。知道這件事,你就會理解它為什麼會編造不存在的資料、為什麼問法不同答案差很多、為什麼重要的數字要自己再查一次。
LLM 的中文翻譯有沒有統一?
台灣普遍寫成「大型語言模型」,國科會的 TAIDE 計畫與 iThome 等媒體都是這個寫法,本站也統一採用。對岸的簡體寫法少了一個「型」字。名詞混用會讓搜尋引擎難以辨識同一個概念,所以我們固定用台灣寫法。
學會 LLM 之後,下一個該學什麼?
建議照這個順序:先搞懂 Token(錢怎麼算),再看 Transformer(架構怎麼來的),最後看 RAG 與 AI 幻覺(它為什麼會亂講、又要怎麼救)。這四個詞湊起來,你就能看懂八成的 AI 新聞了。
延伸閱讀
- Kimi K3 完整權重開源,2.8 兆參數怎麼看 — 一個「超大 LLM」實際長什麼樣子。
- Claude Opus 5 跑分翻倍搶回王座 — 模型的能力差距怎麼被量出來。
- Kimi K3 登場,API 每百萬 token 輸入 3 美元 — token 計價在市場上的樣子。
參考來源
- Attention Is All You Need(arXiv 1706.03762) — Transformer 原始論文,2017 年 Google Brain 團隊發表。
- OpenAI Presents GPT-3, a 175 Billion Parameters Language Model(NVIDIA Technical Blog) — GPT-3 參數量、層數與訓練 token 規模。
- What are tokens and how to count them?(OpenAI Help Center) — token 與英文字元的官方換算。
- Why Language Models Hallucinate(OpenAI, 2025-09) — 評測機制獎勵猜測導致幻覺的研究。
- 國科會釋出繁中語言模型 TAIDE-LX-7B 了!(iThome) — TAIDE 的基底模型與繁中語料。
- Benchmarking Five Major Model Tokenizers(BigGo Finance) — 中文相對英文的 token 消耗差距。
- OpenAI’s Sam Altman says giant A.I. models not necessary(Fortune) — Altman 對「把模型做大」的說法。
整理一下重點:LLM 真的沒有那麼玄,它就是一台把文字接龍練到很誇張的機器,好用跟會唬爛都是同一個原因。
希望這一篇有讓你對 LLM 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。