一句話定義
量化(Quantization)是把 AI 模型裡的數字從高精度換成低精度來存放與計算,用一點點準確度,換回更小的體積跟更快的速度。
30 秒看重點
- 是什麼:量化是把模型裡每個參數佔的位元數砍掉,例如從 16 位元降到 4 位元,檔案就跟著縮水。
- 為什麼重要:它是目前讓大模型塞進一般顯示卡、甚至塞進筆電的最主要手段,成本差距是好幾倍。
- 跟誰相關:想在自己電腦上跑模型的人、要壓低推論帳單的開發團隊,還有好奇「為什麼手機也能跑 AI」的一般使用者。
- 最常見的誤解:很多人以為量化會把模型變笨、參數變少,其實參數一個都沒少,少的是每個參數的小數點細節。
- 記住這件事就夠了:量化砍的是精度,不是知識量。
量化到底是什麼?
量化是把 AI 模型裡的數字改用比較低的精度來存放的技術。llama.cpp 官方文件對它的說明很直白:降低模型權重的精度,例如從 32 位元浮點數改成 4 位元整數,好讓模型變小、推論變快。
要理解它,得先知道模型檔案裡到底裝了什麼。所謂「80 億參數的模型」,意思就是裡面有 80 億個數字,每個數字都記著模型該怎麼反應。這些數字原本用 16 位元或 32 位元浮點數存,一個就要吃掉 2 到 4 個位元組。80 億乘下去,檔案自然是十幾 GB 起跳。量化做的事很單純:同樣那 80 億個數字,我改用 4 位元來記就好。位元數砍到四分之一,檔案也就跟著縮到大約四分之一。
生活比喻:你可以把它想成手搖飲的甜度。全糖、七分、半糖、微糖、無糖,杯子裡裝的還是同一款茶,只是甜度這個細節被你調粗了。調到半糖你大概喝不太出差別,調到微糖開始有感,一路調到無糖就真的變成另一種喝法了。量化就是這樣,Q8 像七分糖,Q4 像半糖,壓到 2 位元以下就是無糖區,喝不喝得下去要看你本來喜歡什麼。
為什麼會有量化?
因為模型長得比硬體快太多了,不壓就是跑不動。
問題一:記憶體根本裝不下。 這點台灣讀者今年特別有感。我們在記憶體漲價那篇寫過,據 TrendForce 統計,韓國 DRAM 出口單價在 2026 年 8 月來到每公斤 92,183 美元、年增 401%,1 公斤記憶體的價錢已經逼近 620 公克的 24K 純金(這什麼世界?!)。在這種行情下,「少吃 10GB 記憶體」不是技術指標,是真的省錢。
問題二:跑得慢、帳單也難看。 模型每次回答你都要把參數搬進搬出,搬的資料越少就越快。llama.cpp 官方 README 把支援 1.5 位元到 8 位元整數量化列為專案特色,理由寫得很清楚:更快的推論、更少的記憶體用量。
「那我直接換一個小一點的模型不就好了?」可以啊,但那是另一件事。小模型是從頭就沒學過那麼多東西,量化則是同一個模型、同樣的本事,只是把數字記粗一點。
所以量化的定位其實滿好懂的:它不讓模型變聰明,它只是讓你跑得起。
量化是怎麼運作的?
說穿了就是先量好尺、再換單位存、最後驗收掉了多少分。
- 找出數值範圍:先掃過這一組權重,看看最大值最小值落在哪,決定要用什麼刻度去對應。刻度抓太寬會浪費、抓太窄會爆掉。
- 換成低位元存放:照這個刻度把每個數字換算成整數存起來。llama.cpp 的表格顯示,Q4_K_M 平均每個權重佔 4.89 位元,Q8_0 佔 8.50 位元,原本的 F16 則是 16.00 位元。
- 驗收掉了多少:官方文件說量化的損失通常用困惑度(perplexity)跟 KL 散度來衡量,而且可以搭配一份「重要性矩陣」把損失壓到最小,等於告訴程式哪些權重比較金貴、下手輕一點。
名詞小教室:GGUF 是你在本地跑模型時最常看到的副檔名。根據 ggml 官方規格文件,它是用來存放模型、給 GGML 系列推論程式讀的單一檔案格式,支援記憶體映射所以載入很快,是 GGML、GGMF、GGJT 這幾代格式的接班人。你下載到的
xxx-Q4_K_M.gguf,檔名後面那串就是它被壓到哪一檔。
量化跟蒸餾差在哪?
量化是把同一個模型的數字記粗一點,蒸餾是另外訓練一個小模型來模仿大模型,一個沒換人、一個換了人。
| 比較項目 | 量化(Quantization) | 蒸餾(Distillation) |
|---|---|---|
| 參數數量有變嗎 | 完全沒變,只是每個參數變瘦 | 變少,本來就是另一個小模型 |
| 要重新訓練嗎 | 事後直接壓就行,不必重訓 | 要,得用大模型的輸出當教材訓練 |
| 花多少時間 | 快的話幾分鐘到幾小時 | 完整一輪訓練,成本高很多 |
| 誰在做 | 社群、個人玩家自己壓都行 | 多半是有算力的團隊或公司 |
| 我會在什麼情況選它 | 模型能力夠、只是裝不進顯示卡 | 想要一個又小又快的專用模型 |
從這張表可以看出來,兩者根本不是互相取代的關係:裝不下就量化,想要一個更小的新模型才叫蒸餾。而且它們可以疊著用,先蒸餾出小模型、再把小模型量化,這在端側裝置上是很常見的組合。講到蒸餾我突然想到,這個詞最近是因為 Anthropic 在 9 月 10 日的威脅情報報告點名阿里巴巴用 1.51 億次對話撈 Claude 才紅起來的,細節我們在AI Agent 煞車在誰手上那篇聊過,跟量化完全是兩件事,別搞混囉。
你會在哪些 AI 工具看到量化?
只要你在自己的電腦上跑過模型,你其實早就用過量化了,只是沒注意到而已。
- Ollama、LM Studio 這類本地工具:你下載的模型幾乎都是量化版。以 Llama-3.1-8B 為例,llama.cpp 官方實測的檔案大小是:F16 原版 14.96 GiB、Q8_0 7.95 GiB、Q5_K_M 5.33 GiB、Q4_K_M 4.58 GiB,再往下壓 IQ2_XXS 只要 2.23 GiB、IQ1_S 更只有 1.87 GiB。從 15GB 到 4.6GB,差的就是一張顯示卡買不買得起。
- Google 官方釋出的 Gemma QAT 版本:Google 開發者部落格公布的數字是 Gemma 3 的 27B 模型從 BF16 的 54GB 降到 int4 的 14.1GB、12B 從 24GB 降到 6.6GB、4B 從 8GB 降到 2.6GB,27B 因此能塞進一張 RTX 3090 的 24GB 顯示記憶體。
- 微調時的省錢方案:bitsandbytes 官方說明裡的 QLoRA,就是先把模型壓到 4 位元,再外掛一小組可訓練的 LoRA 權重去學新東西。想看 LoRA 本身怎麼運作,可以讀我們的 LoRA 條目。
如果你是工程師,最常碰到的入口大概是 bitsandbytes。它的 LLM.int8() 做法是把多數特徵量化到 8 位元、少數離群值另外用 16 位元算,官方說法是能用一半的記憶體做推論、而且沒有效能退化。這句「沒有退化」很關鍵,先記著。
學量化最常見的 3 個誤解
- 誤解一:量化會讓模型變笨。 真相是要看壓到哪一檔。bitsandbytes 官方對 8 位元的說法是記憶體減半且不損失效能;壓到 4 位元開始要看方法跟模型,壓到 2 位元以下就真的會開始講怪話了。把「量化」一律當成降級,是誤會它。
- 誤解二:量化會把參數變少。 不會,一個都不會少。80 億參數量化完還是 80 億參數,變的只是每個參數佔幾個位元。會讓參數真的變少的是剪枝跟蒸餾,那是另外兩回事。
- 誤解三:量化是沒錢的人才用的。 老實講這個觀念早就過時了。Google 自己出的模型就直接附官方量化版本,而且是在訓練階段就先讓模型習慣被壓縮(也就是 QAT),根本不是事後補救。
當然,順便讓大家都跑得動自家模型也是挺划算的啦
想多了解量化,從哪開始?
沒有技術背景的話,你只要記住看檔名就好。以後在 Ollama 或 Hugging Face 上看到 Q4_K_M、Q8_0 這種後綴,你就知道那是壓縮檔位,數字越小檔案越小、也越有機會講錯話。一般情況下從 Q4_K_M 開始試是最保險的起手式,不夠好再往上加。
有技術背景的話,建議直接拿 llama.cpp 的 quantize 工具壓一次同一個模型的不同檔位,自己跑困惑度比一比。這件事比看十篇評測有用,因為量化的損失非常吃模型本身,別人的結論不一定適用在你的模型上(別人的表格別照抄)。
常見問題 FAQ
量化跟 AI 有什麼關係?
量化是讓 AI 模型變得跑得動的壓縮技術。它把模型裡每個參數的數值精度降低,例如從 16 位元浮點數改成 4 位元整數,讓模型檔案縮小、載入更快、需要的記憶體更少。現在絕大多數能在個人電腦或手機上執行的 AI 模型,背後都經過量化這一步。
為什麼量化突然這麼紅?
因為硬體成本在 2026 年變得非常敏感。據 TrendForce 的統計,韓國 DRAM 出口單價在 2026 年 8 月年增 401%,記憶體與顯示卡的價格同步拉高,讓「同樣的模型少吃幾 GB」直接等於省錢。同時本地跑模型的風氣變盛,llama.cpp、Ollama 這類工具把量化模型的門檻降到一般人也能用,量化因此從工程師的技巧變成大眾話題。
我不是工程師也需要懂量化嗎?
不需要會壓,但知道它存在很有用。如果你打算在自己的電腦上跑 AI,量化決定了你那台機器跑不跑得動,也決定了模型的回答品質會掉多少。看得懂 Q4、Q8 這些標示,你在挑模型的時候就不會下載到一個開不起來的檔案。
量化的中文翻譯有沒有統一?
中文圈一律翻成「量化」,兩岸沒有差異,技術文件裡也常常直接寫 Quantization。真正要小心的是台灣的語境問題:「量化」這個詞在本地最常指的是量化交易、量化分析這些金融領域的用法,跟 AI 模型壓縮完全無關。所以本站行文一律寫成「量化」並在前後補上 AI 或模型的語境,避免你搜到金融文章去。
學會量化之後,下一個該學什麼?
建議接著看三個詞:推論(模型回答你的那段過程,量化要省的就是它)、MoE(另一條省算力的路,但省法完全不同)、LoRA(微調時跟量化最常搭在一起用的技巧)。這三個跟量化合起來,大概就能看懂本地模型圈在討論的八成內容了。
延伸閱讀
- AI 推論(Inference)是什麼?模型訓練完之後,每次回答你的那段過程 — 量化最主要的戰場就是推論階段,這篇解釋它為什麼最燒錢。
- MoE 是什麼?混合專家模型怎麼讓大模型只花小模型的算力 — 同樣是省算力,但它省的是「每次叫醒多少參數」,跟量化走完全不同的路。
- AI 的 LoRA 是什麼?低秩適應微調怎麼讓小顯示卡也調得動大模型 — 跟 4 位元量化合體就是 QLoRA,微調省記憶體的主流組合。
- AI 五分鐘快報:記憶體漲價 401%,3 個 AI 圈的關鍵訊號 — 記憶體變貴的實際數字,也是量化今年特別重要的原因。
參考來源
- llama.cpp quantize 工具說明|ggml-org — 量化的定義、Q4_K_M 4.89 與 Q8_0 8.50 位元的每權重數字、Llama-3.1-8B 從 F16 14.96 GiB 到 Q4_K_M 4.58 GiB 的檔案大小表,以及用困惑度與 KL 散度衡量損失的說明。
- llama.cpp 專案 README|ggml-org — 支援 1.5 位元到 8 位元整數量化、目的是更快推論與更少記憶體,以及跨 Apple Silicon、x86、CUDA 等硬體的說明。
- GGUF 格式規格|ggml-org — GGUF 是給 GGML 系列推論用的單一檔案格式、支援記憶體映射快速載入、為 GGML/GGMF/GGJT 接班人,以及 Q 系列與 IQ 系列量化型別清單。
- bitsandbytes 專案 README|bitsandbytes-foundation — LLM.int8() 把多數特徵量化到 8 位元、離群值用 16 位元計算,以半數記憶體推論且無效能退化,以及 QLoRA 先壓 4 位元再掛 LoRA 的做法。
- Gemma 3 QAT 量化模型公告|Google Developers Blog — Gemma 3 27B 從 BF16 的 54GB 降到 int4 的 14.1GB、12B 從 24GB 到 6.6GB、4B 從 8GB 到 2.6GB,以及 27B 可在 RTX 3090 執行的說法。
關於本篇的查證限制:撰寫當下的網路政策擋掉了維基百科、Hugging Face、arXiv、NVIDIA 與 Google 官方網域,只有 GitHub 系來源能直接讀取。來源 1 到 4 是直接讀取原文取得;來源 5 的 Gemma 3 QAT 記憶體數字是透過搜尋結果摘要取得,未能直接開啟官方頁面核對,請以 Google 官方公告為準。文中關於 DRAM 漲價的數字引自本站 9 月 1 日報導所引用的 TrendForce 統計。
整理一下重點:量化真的不是什麼高深的東西,它就是把模型裡的數字記粗一點,換回你裝得下、跑得動的體積,代價是壓越狠、模型講錯話的機率越高。
希望這一篇有讓你對量化多了一點認識哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。