一句話定義

量化(Quantization)是把 AI 模型裡的數字從高精度換成低精度來存放與計算,用一點點準確度,換回更小的體積跟更快的速度。

30 秒看重點

  • 是什麼:量化是把模型裡每個參數佔的位元數砍掉,例如從 16 位元降到 4 位元,檔案就跟著縮水。
  • 為什麼重要:它是目前讓大模型塞進一般顯示卡、甚至塞進筆電的最主要手段,成本差距是好幾倍。
  • 跟誰相關:想在自己電腦上跑模型的人、要壓低推論帳單的開發團隊,還有好奇「為什麼手機也能跑 AI」的一般使用者。
  • 最常見的誤解:很多人以為量化會把模型變笨、參數變少,其實參數一個都沒少,少的是每個參數的小數點細節。
  • 記住這件事就夠了:量化砍的是精度,不是知識量。

量化到底是什麼?

量化是把 AI 模型裡的數字改用比較低的精度來存放的技術。llama.cpp 官方文件對它的說明很直白:降低模型權重的精度,例如從 32 位元浮點數改成 4 位元整數,好讓模型變小、推論變快。

要理解它,得先知道模型檔案裡到底裝了什麼。所謂「80 億參數的模型」,意思就是裡面有 80 億個數字,每個數字都記著模型該怎麼反應。這些數字原本用 16 位元或 32 位元浮點數存,一個就要吃掉 2 到 4 個位元組。80 億乘下去,檔案自然是十幾 GB 起跳。量化做的事很單純:同樣那 80 億個數字,我改用 4 位元來記就好。位元數砍到四分之一,檔案也就跟著縮到大約四分之一。

生活比喻:你可以把它想成手搖飲的甜度。全糖、七分、半糖、微糖、無糖,杯子裡裝的還是同一款茶,只是甜度這個細節被你調粗了。調到半糖你大概喝不太出差別,調到微糖開始有感,一路調到無糖就真的變成另一種喝法了。量化就是這樣,Q8 像七分糖,Q4 像半糖,壓到 2 位元以下就是無糖區,喝不喝得下去要看你本來喜歡什麼。

為什麼會有量化?

因為模型長得比硬體快太多了,不壓就是跑不動。

問題一:記憶體根本裝不下。 這點台灣讀者今年特別有感。我們在記憶體漲價那篇寫過,據 TrendForce 統計,韓國 DRAM 出口單價在 2026 年 8 月來到每公斤 92,183 美元、年增 401%,1 公斤記憶體的價錢已經逼近 620 公克的 24K 純金(這什麼世界?!)。在這種行情下,「少吃 10GB 記憶體」不是技術指標,是真的省錢。

問題二:跑得慢、帳單也難看。 模型每次回答你都要把參數搬進搬出,搬的資料越少就越快。llama.cpp 官方 README 把支援 1.5 位元到 8 位元整數量化列為專案特色,理由寫得很清楚:更快的推論、更少的記憶體用量。

「那我直接換一個小一點的模型不就好了?」可以啊,但那是另一件事。小模型是從頭就沒學過那麼多東西,量化則是同一個模型、同樣的本事,只是把數字記粗一點。

所以量化的定位其實滿好懂的:它不讓模型變聰明,它只是讓你跑得起

量化是怎麼運作的?

說穿了就是先量好尺、再換單位存、最後驗收掉了多少分。

  1. 找出數值範圍:先掃過這一組權重,看看最大值最小值落在哪,決定要用什麼刻度去對應。刻度抓太寬會浪費、抓太窄會爆掉。
  2. 換成低位元存放:照這個刻度把每個數字換算成整數存起來。llama.cpp 的表格顯示,Q4_K_M 平均每個權重佔 4.89 位元,Q8_0 佔 8.50 位元,原本的 F16 則是 16.00 位元。
  3. 驗收掉了多少:官方文件說量化的損失通常用困惑度(perplexity)跟 KL 散度來衡量,而且可以搭配一份「重要性矩陣」把損失壓到最小,等於告訴程式哪些權重比較金貴、下手輕一點。

名詞小教室:GGUF 是你在本地跑模型時最常看到的副檔名。根據 ggml 官方規格文件,它是用來存放模型、給 GGML 系列推論程式讀的單一檔案格式,支援記憶體映射所以載入很快,是 GGML、GGMF、GGJT 這幾代格式的接班人。你下載到的 xxx-Q4_K_M.gguf,檔名後面那串就是它被壓到哪一檔。

量化跟蒸餾差在哪?

量化是把同一個模型的數字記粗一點,蒸餾是另外訓練一個小模型來模仿大模型,一個沒換人、一個換了人。

比較項目量化(Quantization)蒸餾(Distillation)
參數數量有變嗎完全沒變,只是每個參數變瘦變少,本來就是另一個小模型
要重新訓練嗎事後直接壓就行,不必重訓要,得用大模型的輸出當教材訓練
花多少時間快的話幾分鐘到幾小時完整一輪訓練,成本高很多
誰在做社群、個人玩家自己壓都行多半是有算力的團隊或公司
我會在什麼情況選它模型能力夠、只是裝不進顯示卡想要一個又小又快的專用模型

從這張表可以看出來,兩者根本不是互相取代的關係:裝不下就量化,想要一個更小的新模型才叫蒸餾。而且它們可以疊著用,先蒸餾出小模型、再把小模型量化,這在端側裝置上是很常見的組合。講到蒸餾我突然想到,這個詞最近是因為 Anthropic 在 9 月 10 日的威脅情報報告點名阿里巴巴用 1.51 億次對話撈 Claude 才紅起來的,細節我們在AI Agent 煞車在誰手上那篇聊過,跟量化完全是兩件事,別搞混囉。

你會在哪些 AI 工具看到量化?

只要你在自己的電腦上跑過模型,你其實早就用過量化了,只是沒注意到而已。

  • Ollama、LM Studio 這類本地工具:你下載的模型幾乎都是量化版。以 Llama-3.1-8B 為例,llama.cpp 官方實測的檔案大小是:F16 原版 14.96 GiB、Q8_0 7.95 GiB、Q5_K_M 5.33 GiB、Q4_K_M 4.58 GiB,再往下壓 IQ2_XXS 只要 2.23 GiB、IQ1_S 更只有 1.87 GiB。從 15GB 到 4.6GB,差的就是一張顯示卡買不買得起。
  • Google 官方釋出的 Gemma QAT 版本:Google 開發者部落格公布的數字是 Gemma 3 的 27B 模型從 BF16 的 54GB 降到 int4 的 14.1GB、12B 從 24GB 降到 6.6GB、4B 從 8GB 降到 2.6GB,27B 因此能塞進一張 RTX 3090 的 24GB 顯示記憶體。
  • 微調時的省錢方案:bitsandbytes 官方說明裡的 QLoRA,就是先把模型壓到 4 位元,再外掛一小組可訓練的 LoRA 權重去學新東西。想看 LoRA 本身怎麼運作,可以讀我們的 LoRA 條目

如果你是工程師,最常碰到的入口大概是 bitsandbytes。它的 LLM.int8() 做法是把多數特徵量化到 8 位元、少數離群值另外用 16 位元算,官方說法是能用一半的記憶體做推論、而且沒有效能退化。這句「沒有退化」很關鍵,先記著。

學量化最常見的 3 個誤解

  1. 誤解一:量化會讓模型變笨。 真相是要看壓到哪一檔。bitsandbytes 官方對 8 位元的說法是記憶體減半且不損失效能;壓到 4 位元開始要看方法跟模型,壓到 2 位元以下就真的會開始講怪話了。把「量化」一律當成降級,是誤會它。
  2. 誤解二:量化會把參數變少。 不會,一個都不會少。80 億參數量化完還是 80 億參數,變的只是每個參數佔幾個位元。會讓參數真的變少的是剪枝跟蒸餾,那是另外兩回事。
  3. 誤解三:量化是沒錢的人才用的。 老實講這個觀念早就過時了。Google 自己出的模型就直接附官方量化版本,而且是在訓練階段就先讓模型習慣被壓縮(也就是 QAT),根本不是事後補救。當然,順便讓大家都跑得動自家模型也是挺划算的啦

想多了解量化,從哪開始?

沒有技術背景的話,你只要記住看檔名就好。以後在 Ollama 或 Hugging Face 上看到 Q4_K_MQ8_0 這種後綴,你就知道那是壓縮檔位,數字越小檔案越小、也越有機會講錯話。一般情況下從 Q4_K_M 開始試是最保險的起手式,不夠好再往上加。

有技術背景的話,建議直接拿 llama.cpp 的 quantize 工具壓一次同一個模型的不同檔位,自己跑困惑度比一比。這件事比看十篇評測有用,因為量化的損失非常吃模型本身,別人的結論不一定適用在你的模型上(別人的表格別照抄)。


常見問題 FAQ

量化跟 AI 有什麼關係?

量化是讓 AI 模型變得跑得動的壓縮技術。它把模型裡每個參數的數值精度降低,例如從 16 位元浮點數改成 4 位元整數,讓模型檔案縮小、載入更快、需要的記憶體更少。現在絕大多數能在個人電腦或手機上執行的 AI 模型,背後都經過量化這一步。

為什麼量化突然這麼紅?

因為硬體成本在 2026 年變得非常敏感。據 TrendForce 的統計,韓國 DRAM 出口單價在 2026 年 8 月年增 401%,記憶體與顯示卡的價格同步拉高,讓「同樣的模型少吃幾 GB」直接等於省錢。同時本地跑模型的風氣變盛,llama.cpp、Ollama 這類工具把量化模型的門檻降到一般人也能用,量化因此從工程師的技巧變成大眾話題。

我不是工程師也需要懂量化嗎?

不需要會壓,但知道它存在很有用。如果你打算在自己的電腦上跑 AI,量化決定了你那台機器跑不跑得動,也決定了模型的回答品質會掉多少。看得懂 Q4、Q8 這些標示,你在挑模型的時候就不會下載到一個開不起來的檔案。

量化的中文翻譯有沒有統一?

中文圈一律翻成「量化」,兩岸沒有差異,技術文件裡也常常直接寫 Quantization。真正要小心的是台灣的語境問題:「量化」這個詞在本地最常指的是量化交易、量化分析這些金融領域的用法,跟 AI 模型壓縮完全無關。所以本站行文一律寫成「量化」並在前後補上 AI 或模型的語境,避免你搜到金融文章去。

學會量化之後,下一個該學什麼?

建議接著看三個詞:推論(模型回答你的那段過程,量化要省的就是它)、MoE(另一條省算力的路,但省法完全不同)、LoRA(微調時跟量化最常搭在一起用的技巧)。這三個跟量化合起來,大概就能看懂本地模型圈在討論的八成內容了。


延伸閱讀


參考來源

  1. llama.cpp quantize 工具說明|ggml-org — 量化的定義、Q4_K_M 4.89 與 Q8_0 8.50 位元的每權重數字、Llama-3.1-8B 從 F16 14.96 GiB 到 Q4_K_M 4.58 GiB 的檔案大小表,以及用困惑度與 KL 散度衡量損失的說明。
  2. llama.cpp 專案 README|ggml-org — 支援 1.5 位元到 8 位元整數量化、目的是更快推論與更少記憶體,以及跨 Apple Silicon、x86、CUDA 等硬體的說明。
  3. GGUF 格式規格|ggml-org — GGUF 是給 GGML 系列推論用的單一檔案格式、支援記憶體映射快速載入、為 GGML/GGMF/GGJT 接班人,以及 Q 系列與 IQ 系列量化型別清單。
  4. bitsandbytes 專案 README|bitsandbytes-foundation — LLM.int8() 把多數特徵量化到 8 位元、離群值用 16 位元計算,以半數記憶體推論且無效能退化,以及 QLoRA 先壓 4 位元再掛 LoRA 的做法。
  5. Gemma 3 QAT 量化模型公告|Google Developers Blog — Gemma 3 27B 從 BF16 的 54GB 降到 int4 的 14.1GB、12B 從 24GB 到 6.6GB、4B 從 8GB 到 2.6GB,以及 27B 可在 RTX 3090 執行的說法。

關於本篇的查證限制:撰寫當下的網路政策擋掉了維基百科、Hugging Face、arXiv、NVIDIA 與 Google 官方網域,只有 GitHub 系來源能直接讀取。來源 1 到 4 是直接讀取原文取得;來源 5 的 Gemma 3 QAT 記憶體數字是透過搜尋結果摘要取得,未能直接開啟官方頁面核對,請以 Google 官方公告為準。文中關於 DRAM 漲價的數字引自本站 9 月 1 日報導所引用的 TrendForce 統計。


整理一下重點:量化真的不是什麼高深的東西,它就是把模型裡的數字記粗一點,換回你裝得下、跑得動的體積,代價是壓越狠、模型講錯話的機率越高。

希望這一篇有讓你對量化多了一點認識哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。