一句話定義
模型微調(Fine-tuning)是拿一個已經訓練好的 AI 模型,再用一批特定領域的資料繼續訓練,讓它更擅長某個任務的做法。
30 秒看重點
- 是什麼:模型微調是在別人已經訓練好的大模型上面,用你自己的資料再訓練一輪,把它調成你要的樣子。
- 為什麼重要:它是目前讓 AI 學會特定語氣、格式與專業判斷最直接的手段,成本也遠低於從零訓練一個模型。
- 跟誰相關:想做垂直領域 AI 產品的開發者、要把 AI 導進內部系統的企業 IT 團隊,還有好奇「為什麼有些 AI 特別懂某個行業」的一般使用者。
- 最常見的誤解:很多人以為微調可以讓 AI 知道最新消息,但那是 RAG 的工作,微調改的是行為不是資料庫。
- 記住這件事就夠了:微調改的是 AI 的「本事」,不是它的「查得到什麼」。
模型微調到底是什麼?
模型微調是拿一個已經預訓練完成的大模型,用一批規模小很多的專門資料再訓練一次,讓它在特定任務上表現更好的做法。英文就叫 Fine-tuning,你在各家 AI 公司的技術文件裡看到的都是這個字。
要理解微調,得先知道它動的是什麼。一個大型語言模型內部有幾千億個參數(你可以想成幾千億顆決定它怎麼接話的旋鈕),預訓練階段吃的是整個網路等級的文字,燒掉的是天文數字的電費。微調完全不同,它吃的是幾百到幾萬筆「示範答案」,只把那些旋鈕往你要的方向轉一點點。所以微調的門檻低到一般團隊也玩得起。
生活比喻:你可以想像成一個什麼菜都會做一點的總鋪師。辦桌、快炒、甜湯他都行,可是你今天要開的是鹽酥雞攤,客人只在乎那一味。微調就是把他請來,連續三個月只讓他炸鹽酥雞、只讓他調那個椒鹽粉比例。三個月後他炸的鹽酥雞比誰都準,代價是他的辦桌手感可能生疏了一些。
為什麼會有模型微調?
因為通用模型什麼都會一點,可是當你要它穩定產出某種格式、某種語氣、某個行業的判斷時,光靠提示詞常常壓不住。
問題一:格式跟語氣的穩定度。 你要 AI 每次都回傳同一種結構的客服回信,提示詞寫到五百字它還是會偶爾自由發揮。這種「知道答案但講法不對」的狀況,正是微調的主場。
問題二:語言跟領域的落差。 這點台灣讀者最有感。一個吃全球語料長大的模型,講繁體中文常常帶著怪腔,遇到本地法規或醫療用語更是會歪掉。林彥廷(Yen-Ting Lin)在 2023 年 7 月發起的 Taiwan LLM 計畫就是衝著這件事來的,他們拿 Meta 的 Llama-3 當底,餵進繁體中文與法律、製造、醫療、電子等領域的語料再訓練,做出 Llama-3-Taiwan-70B。根據專案 README 公布的數字,它在 TMLU 這項台灣在地評測拿到 74.76%,原版 Llama-3-70B 是 70.95%。中間那 3.8 個百分點,就是微調買來的。
順帶一提,這個專案背後掛名支援的包括長庚醫院、長春集團、和碩、欣興電子跟輝達,看得出來台灣產業對「自己的模型」其實是有需求的。
模型微調是怎麼運作的?
說穿了就三件事:準備成對的示範資料、拿這些資料再訓練一輪、然後驗收再放上線。
- 準備資料:把「使用者會這樣問」跟「我要 AI 這樣答」湊成一對一對的範例,通常存成 JSONL 這類每行一筆的格式。這一步最花時間,也最決定成敗,資料歪一點模型就歪一大片。
- 再訓練一輪:把這批範例餵進模型,讓它照著調整內部參數。可以整組參數全改(全參數微調),也可以只外掛一小組新參數(就是下面要講的 LoRA)。
- 驗收再上線:拿模型沒看過的題目測一輪,確認它在新任務變強、舊本事沒退化,才敢推到正式環境。
名詞小教室:LoRA(Low-Rank Adaptation,低秩適應)是微調界最常見的省錢法。根據微軟官方的 LoRA 專案說明,它把原本的權重整個凍住,只額外學一組很小的矩陣,RoBERTa base 原本要訓練 1.25 億個參數,用 LoRA 之後只剩 80 萬個,而且不會增加推論延遲。想看細節可以讀我們寫過的 LoRA 條目。
模型微調跟 RAG 差在哪?
微調改的是 AI 的「本事」,RAG 改的是 AI「查得到什麼」,兩件事其實不衝突,搭在一起用也完全沒問題。
| 比較項目 | 模型微調(Fine-tuning) | RAG(檢索增強生成) |
|---|---|---|
| 解決什麼問題 | 語氣、格式、專業判斷不穩 | 模型不知道新的或內部的資料 |
| 動到模型本身嗎 | 會,直接改參數 | 不會,只是回答前先去翻資料 |
| 更新即時性 | 慢,要重跑一次訓練 | 快,換掉資料庫內容就好 |
| 成本結構 | 前期訓練貴,之後推論便宜 | 前期便宜,但每次回答都多一段檢索 |
| 我會在什麼情況選它 | 要它「每次都用同一種方式回答」 | 要它「知道公司最新的那份文件」 |
從這張表可以看出來,兩者的分工其實滿清楚的:要改行為就微調,要補知識就走 RAG。如果你的困擾是「AI 答錯內部規定」,先做 RAG;如果是「AI 答得都對,就是講話不像我們公司」,那才輪到微調上場。
你會在哪些 AI 工具看到模型微調?
微調不是實驗室裡的東西,你每天在用的產品背後很多都跑過這一段。
- Stable Diffusion 的各種畫風模型:那些幾十 MB 的 LoRA 檔案就是微調產物。Hugging Face 的官方說明提到,用 LoRA 訓練 Stable Diffusion 只要 15.5GB 顯示記憶體,全參數微調則要 27.5GB。
- 各家的程式模型:Cognition 在 9 月發表的 SWE-2 就是拿開源的 Kimi K3 當底再微調,官方說法是成本比同級模型低 64%,這件事我們在前沿實驗室該不該踩煞車那篇聊過。
- 台灣自己的模型:前面講的 Llama-3-Taiwan 系列,就是為了繁體中文語感跟本地產業知識做的微調。
- ChatGPT 本身:它從 GPT-3 變成會聊天的樣子,靠的也是微調家族的技術,細節可以看 RLHF 條目。
如果你是工程師,最常碰到的入口是 Hugging Face 的 PEFT 套件。它主打只訓練模型裡極小一部分參數,官方文件舉的例子是 mt0-large 只訓練了 0.19% 的參數;而在 A100 上微調 T0_3B,全參數要 47.14GB 顯示記憶體,換成 PEFT-LoRA 只要 14.4GB。
學模型微調最常見的 3 個誤解
- 誤解一:微調可以讓 AI 知道最新消息。 真相是不行。微調教的是「怎麼回答」,不是「記住什麼」,你要 AI 知道今天的股價或公司昨天發的公告,那是 RAG 的活。硬用微調塞知識,塞得進去也不穩。
- 誤解二:微調一定要很有錢、很多顯示卡。 其實這幾年早就不用了。Hugging Face 的 PEFT 部落格示範過用 RTX 2080 Ti 這種 11GB 的消費級顯示卡去調 30 億參數的模型;QLoRA 論文更誇張,Dettmers 等人在 2023 年展示用單張 48GB 顯示卡就微調 650 億參數的模型,訓練出來的 Guanaco 只花 24 小時。
- 誤解三:微調只會讓模型變強,不會變弱。 不,它會變弱,這叫災難性遺忘(catastrophic forgetting),Hugging Face 明講這是全參數微調會觀察到的行為,也是他們推 PEFT 的理由之一。就是我們那位總鋪師,鹽酥雞炸神了,辦桌手感卻回不去了。
想多了解模型微調,從哪開始?
沒有技術背景的話,你只要抓住一個判斷力就夠了:下次看到有廠商說「我們的 AI 專為醫療打造」,你可以追問一句「是微調過的模型,還是只是換了提示詞?」這兩者的成本跟效果差很多,能問出這句話,你在評估工具時已經贏一半。
有技術背景的話,建議從 Hugging Face 的 PEFT 專案開始摸,它把 LoRA、QLoRA 都包好了,門檻比想像中低。真的要投入之前,先確認你的問題不是 RAG 或提示詞就能解決,不然很容易花了三週訓練,換來一個「跟原本差不多但更難維護」的模型(那就真的白忙了)。
常見問題 FAQ
模型微調跟 AI 有什麼關係?
模型微調是訓練 AI 模型的其中一個階段。一個大型語言模型會先經過預訓練學會通用語言能力,接著透過微調學會特定任務的表現方式。現在市面上絕大多數標榜「專精某領域」的 AI 產品,背後都有微調這一步。
為什麼 OpenAI 要收掉自己的微調服務?
根據 OpenAI 在 2026 年 5 月公告的淘汰時程,自家的微調平台正在分階段關閉:5 月 7 日起沒跑過微調的組織無法再開新任務,7 月 2 日起限縮到近 60 天內有使用紀錄的客戶,2027 年 1 月 6 日之後所有人都不能再建立新的微調任務,已經訓練好的模型則會留到底層模型退場為止。OpenAI 給的理由是新一代模型遵循指令與格式的能力已經夠好,需要微調的情境變少了。老實講這個理由只對了一半,畢竟把客戶留在通用模型上,帳單也比較好看,不過對多數團隊來說,先把提示詞跟 RAG 做好確實比急著微調划算。
我不是工程師也需要懂模型微調嗎?
不需要會做,但知道它存在對你有好處。如果你常用 AI 工具,了解微調可以幫你判斷一個 AI 產品到底是真的有技術投入,還是只在通用模型外面包一層介面。這在挑工具、評估報價的時候差別很大。
模型微調的中文翻譯有沒有統一?
台灣繁體中文圈通常寫成「微調」或「模型微調」,技術文件裡直接用英文 Fine-tuning 也很常見。中國那邊用的也是同樣兩個字,這個詞兩岸差異不大。本站統一使用「模型微調」,行文中提到英文時保留 Fine-tuning 原文,方便你回頭對照原始文件。
學會模型微調之後,下一個該學什麼?
建議接著看三個詞:LoRA(省顯示記憶體的微調技巧)、RAG(補知識用的另一條路)、RLHF(用人類偏好訓練模型的方法)。這三個跟微調組成一個完整的概念網,看完你大概就能看懂大部分 AI 模型發表會在講什麼了。
延伸閱讀
- AI 的 LoRA 是什麼?低秩適應微調怎麼讓小顯示卡也調得動大模型 — 微調最主流的省錢做法,這篇把它的原理拆得更細。
- RAG 是什麼?一次搞懂檢索增強生成怎麼讓 AI 少亂講話 — 跟微調最容易搞混的一條路,想補知識該選它。
- RLHF 是什麼?ChatGPT 比 GPT-3 更會聊天的關鍵訓練法 — 微調家族裡最有名的一種,用人類排名來調模型。
- 前沿實驗室該不該踩煞車?Cognition 用開源底模微調的 SWE-2 — 微調在商業競爭上怎麼被用來壓低成本的實例。
參考來源
- PEFT 官方說明|Hugging Face — mt0-large 只訓練 0.19% 參數、T0_3B 全參數微調 47.14GB 對比 PEFT-LoRA 14.4GB,以及 Stable Diffusion 15.5GB 與 27.5GB 的對照,都出自這裡。
- Parameter-Efficient Fine-Tuning 部落格|Hugging Face — 全參數微調在消費級硬體上不可行、災難性遺忘的說明,以及用 11GB 的 RTX 2080 Ti 微調 30 億參數模型的示範。
- LoRA 官方專案|Microsoft — 凍結原權重只學低秩矩陣的做法、RoBERTa base 從 1.25 億降到 80 萬個可訓練參數,以及不增加推論延遲的說法。
- QLoRA 官方專案|artidoro — 單張 48GB 顯示卡微調 650 億參數模型、NF4 量化,以及 Guanaco 訓練 24 小時的數字。
- Taiwan LLM 專案|MiuLab — 林彥廷 2023 年 7 月發起、以 Llama-3 為底、Llama-3-Taiwan-70B 在 TMLU 拿 74.76% 對比原版 70.95%,以及合作單位名單。
關於本篇的查證限制:撰寫當下網路政策擋掉了 OpenAI、維基百科與 arXiv 等網域。OpenAI 微調平台的三段淘汰時程(2026 年 5 月 7 日、7 月 2 日、2027 年 1 月 6 日)與官方理由,是由 OpenAI 開發者文件的 Deprecations 頁面與多家科技媒體報導交叉比對得出,未能直接讀取官方頁面。請以 OpenAI 最新公告為準。
整理一下重點:微調真的不是什麼高不可攀的東西,它就是拿別人訓練好的模型,餵一批自己的資料讓它學會你要的那一味,代價是它可能會忘掉一點原本的本事。
希望這一篇有讓你對模型微調有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。