一句話定義
預訓練(Pre-training)是用海量文字反覆訓練 AI 預測下一個字,讓它先學會通用語言能力與世界常識的第一階段訓練。
30 秒看重點
- 是什麼:預訓練是模型訓練流程的第一站,用大量未標註的文字教模型「看前面猜後面」。
- 為什麼重要:一個模型懂多少事、知識停在哪一天,幾乎都是在這一階段決定的。
- 跟誰相關:好奇 AI 為什麼不知道上週新聞的一般使用者、要選模型的工程師、要算電費跟碳排的企業決策者。
- 最常見的誤解:很多人以為 ChatGPT 每天在偷偷學新東西,其實預訓練是一次性的大工程,平常不會更新。
- 記住這件事就夠了:預訓練負責「懂很多」,後面的訓練才負責「會講話」。
預訓練到底是什麼?
預訓練是把整個網路等級的文字倒進模型,讓它做幾兆次「猜下一個字」的練習,藉此學會語言規律與世界常識的階段。英文叫 Pre-training,GPT 那個 P 就是它。
Anthropic 在官方的透明度中心把訓練拆成兩段講得很清楚:模型先經過預訓練,用「大量且多元的資料集」取得基礎語言能力,之後才進入後訓練(post-training),用人類回饋強化學習、AI 回饋強化學習等手法,把它調成一個會好好回話的助理。順序不能倒過來,因為後訓練調的是「態度」,預訓練給的是「底子」。
同一份文件也列了預訓練資料從哪來:公開網路內容、公開與非公開的第三方資料集、付費承包商與標註服務產出的資料、有選擇加入的使用者資料,以及模型自己生成的合成資料。這些東西丟進去之前還會經過去重與分類過濾。所以「AI 就是把網路全部背起來」這句話,其實只對一半啦。
生活比喻:你可以想像成一場沒有盡頭的文字接龍大賽。模型被關在一個房間裡,房間堆滿整個網路印出來的紙,它的工作只有一件:看前面的字,猜下一個字。猜錯被糾正一次,猜對就把那個手感記起來。這樣猜個幾兆次之後,語言的規律、常識、甚至各種寫作風格,就被壓進那幾千億顆參數裡了。
為什麼會有預訓練這個階段?
因為「懂語言」跟「會做事」是兩件事,硬要一次教會,資料成本會爆炸。
老實講這件事在 AI 圈算是踩過坑才想通的。如果每個任務都從零訓練一個模型,你得替翻譯準備一套標註資料、替客服準備另一套、替寫程式再準備一套,每一套都要人工標,貴到根本不可能規模化 QQ。
預訓練把這件事翻轉過來:先用不需要人工標註的方式,讓模型自己從文字裡學。怎麼做到不用標註?很簡單,答案就藏在資料本身 — 把一句話遮掉最後一個字,前面那串就是題目、被遮掉的就是標準答案。資料自己當自己的考卷,這就是自監督式學習。
有了這個底子之後,後面要它學什麼都快得多。這也是為什麼現在幾乎沒有團隊會從零開始蓋一個前沿模型,大家都是拿別人預訓練好的權重回來接著調。
預訓練是怎麼運作的?
拆開來看就三步:把文字切碎、餵進去猜下一個、猜錯就微微轉動參數。
- 切成 Token:模型不認得中文字,它認得的是 Token(切碎後的最小處理單位)。整批語料會先被切成一長串 Token 編號。Llama 3.1 的官方模型卡就直接寫了訓練量:約 15 兆個 Token,全部來自公開來源。
- 做文字接龍:模型看著前面那串 Token,輸出「下一個 Token 是誰」的機率分佈。這時候的模型只會接話,不會回答問題,你問它「台北在哪」,它可能回你「台北在哪裡呢?這是一個好問題」,因為網路上的句子就長那樣。
- 修正參數:猜出來的跟正確答案有落差,這個落差會反過來微幅調整模型內部的參數。重複幾兆次,落差就愈縮愈小。
名詞小教室:這裡的「參數」你可以想成模型內部幾千億顆決定它怎麼接話的旋鈕。預訓練就是拿整個網路當砂紙,把每顆旋鈕磨到大致對的位置。想更細看語言模型本體,可以看LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini;想知道這些參數裝在什麼骨架上,就看 Transformer 是什麼?2017 年一篇論文怎麼變成所有 AI 的地基。
預訓練跟微調差在哪?
預訓練是從零把一個模型養大,微調是拿養好的模型再送去補習班,兩者的規模差好幾個數量級。
| 比較項目 | 預訓練(Pre-training) | 微調(Fine-tuning) |
|---|---|---|
| 從哪開始 | 參數隨機初始化,從零開始 | 拿一個已經預訓練好的模型 |
| 資料量 | 兆級 Token,未標註 | 幾百到幾萬筆示範答案 |
| 資料要不要人工標 | 不用,自監督 | 通常要,品質決定成敗 |
| 誰做得起 | 大廠與國家級團隊 | 一般團隊也玩得起 |
| 學到什麼 | 通用語言能力與世界知識 | 特定任務的表現方式 |
| 我會在什麼情況選它 | 幾乎不會,除非你手上有整座資料中心 | 要讓模型學會某種特定格式或語氣時 |
從這張表可以看出來,兩者根本不是替代關係,是先後關係。實務上你要做的判斷從來不是「預訓練還是微調」,而是「要不要微調」,因為預訓練這個選項對 99.9% 的人來說壓根不存在。想細看微調那一段,模型微調(Fine-tuning)是什麼?為什麼有些 AI 更懂醫療、更會寫程式那篇講得更完整。
訓練一個模型要燒掉多少電和錢?
這是預訓練最有感的部分:Meta 的 Llama 3.1 系列,光預訓練就吃掉 3,930 萬個 GPU 小時。
這個數字攤開來看比較有畫面。Llama 3.1 官方模型卡列出的細項是 8B 用掉 146 萬、70B 用掉 700 萬、405B 用掉 3,084 萬 GPU 小時,硬體是單張 TDP 700 瓦的 H100-80GB。3,930 萬小時是什麼概念?如果你只有一張顯示卡,這場訓練要跑四千多年才會結束(沒錯,四千年)。碳排的部分,模型卡自己揭露的是以電網為基準的 11,390 公噸 CO2 當量,另外標註 Meta 用 100% 再生能源抵銷,以市場基準計算是 0 公噸。用再生能源抵銷之後就標 0,這樣算合不合理我們覺得還可以再討論,但至少人家願意把原始數字攤出來。
那小一點的呢?Karpathy 的 nanoGPT 專案說得很實在:重現那個 1.24 億參數的 GPT-2,用一台 8 張 A100 40GB 的機器,大概要跑四天。同一件事,換到今天的前沿模型規模,中間差的是好幾個數量級。
「所以只有大廠才玩得起?」差不多是這樣,但還有一條中間路線叫續訓(continual pre-training):拿別人開源的權重回來,用你自己那一批語料再預訓練一段。我們在 AI 五分鐘快報:OpenAI 宣告 AGI 時代?3 大變化一次看 報過一個典型案例 — 沙烏地 PIF 旗下的 HUMAIN 發表的 humain-m3,底子是中國 MiniMax 的 MiniMax-M3,再用超過 1 兆 Token 的阿拉伯語內容續做預訓練。喊「主權 AI」喊最大聲的國家,地基是別人的開源權重,這個畫面滿有意思的。
學預訓練最常見的 3 個誤解
- 誤解一:ChatGPT 會從我的對話裡即時學習 — 不會。預訓練是一次性的大型工程,跑完就定案了
不然那個電費誰付。你今天跟它講的話不會馬上進到模型參數裡。 - 誤解二:預訓練完的模型就能直接拿來聊天 — 不行。預訓練出來的是「基礎模型」,只會接話不會答題。要能好好對話,得靠後訓練那一段。Anthropic 的透明度中心把這兩段分得很開,就是這個原因。
- 誤解三:資料愈多模型一定愈強 — 沒那麼單純。Anthropic 說明資料會經過去重與分類過濾,代表清理的重要性不輸蒐集。垃圾進、垃圾出這句老話,在兆級規模下只會被放大。
想多了解預訓練,從哪開始?
沒有技術背景的你:先去看你常用那個模型的規格頁,找「知識截止日」那一欄。以 Claude 為例,官方模型總覽表就明列 Opus 5.5 與 Fable 5.1 的訓練資料截止在 2026 年 6 月、Sonnet 5 是 2026 年 1 月、Haiku 4.5 是 2025 年 7 月。這欄數字就是預訓練留下的指紋,看懂它,你就知道什麼時候該叫 AI 去查資料而不是憑記憶回答。
有技術背景的你:直接 clone 一份 nanoGPT 跑跑看。它用的是 OpenWebText(OpenAI 私有 WebText 資料集的開源重現版),整條流程從切 Token 到訓練到驗證損失收斂到 2.85 左右,全部攤在你面前。自己跑過一次,比讀十篇解釋文都有感。
常見問題 FAQ
預訓練跟 AI 有什麼關係?
預訓練是現代 AI 模型訓練流程的第一個階段,負責讓模型取得通用語言能力與世界知識。Anthropic 在官方透明度中心說明,Claude 會先經過預訓練建立基礎能力,之後才用後訓練調整行為。市面上所有大型語言模型,包含 ChatGPT、Claude、Gemini、Llama,都經過這一步。
為什麼 AI 會有「知識截止日」?
因為預訓練是一次性的工程,資料蒐集到某個時間點就停止,之後發生的事模型自然不知道。以 Claude 為例,官方模型總覽列出 Opus 5.5 與 Fable 5.1 的訓練資料截止於 2026 年 6 月,Haiku 4.5 是 2025 年 7 月;Meta 的 Llama 3.1 模型卡則標示知識截止日為 2023 年 12 月。想突破這個限制,通常是靠搜尋工具或檢索增強生成,而不是重新預訓練。
我不是工程師也需要懂預訓練嗎?
不需要會做,但知道它存在會讓你用 AI 用得更準。理解預訓練之後你會明白三件事:模型不知道最近的事不是它壞掉、同一家公司的不同模型知識範圍可能不一樣、以及要問時事類問題時應該讓 AI 去查資料。這三個認知可以省掉你很多無謂的來回。
預訓練的中文翻譯有沒有統一?
台灣與中國中文圈都寫「預訓練」,這個詞算是少數兩岸一致的 AI 術語。比較常見的分歧在同一家族的其他詞,例如 continual pre-training 台灣多講「續訓」或「持續預訓練」。本站統一使用「預訓練」,英文保留 Pre-training 原文,方便讀者回頭對照官方文件。
學會預訓練之後,下一個該學什麼?
建議往三個方向走:模型微調,看懂預訓練之後的那一段在做什麼;Token,因為預訓練的規模全部用 Token 計量,搞懂它才讀得動那些兆級數字;還有 AI 幻覺,理解模型為什麼會在知識邊界之外開始編故事。這三個串起來,你對 AI 的能力邊界就會有完整的圖。
延伸閱讀
- 模型微調(Fine-tuning)是什麼?為什麼有些 AI 更懂醫療、更會寫程式 — 預訓練的下一站,那篇用總鋪師改練鹽酥雞的比喻拆給你看。
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — 預訓練養出來的東西本體長什麼樣。
- AI 的 Token 是什麼?一次搞懂 AI 計費單位、中文換算與上下文上限 — 兆級訓練資料的計量單位就是它。
- AI 幻覺(Hallucination)是什麼?為什麼 ChatGPT 會一本正經地亂講話 — 預訓練沒學到的東西,模型會怎麼硬掰。
- AI 五分鐘快報:OpenAI 宣告 AGI 時代?3 大變化一次看 — HUMAIN 用 1 兆 Token 阿拉伯語內容續做預訓練,續訓路線的真實案例。
參考來源
- Transparency Hub|Anthropic — 訓練分成預訓練與後訓練兩階段、預訓練資料來源清單,以及去重與分類過濾的資料處理說明。
- Models overview|Claude Platform Docs — 各 Claude 模型的訓練資料截止日(Opus 5.5 與 Fable 5.1 為 2026 年 6 月、Sonnet 5 為 2026 年 1 月、Haiku 4.5 為 2025 年 7 月),以及可靠知識截止日與訓練資料截止日是兩個不同欄位。
- Llama 3.1 Model Card|meta-llama — 約 15 兆 Token 公開來源訓練資料、3,930 萬 GPU 小時(8B 146 萬、70B 700 萬、405B 3,084 萬)、H100-80GB 700W TDP、知識截止日 2023 年 12 月,以及 11,390 公噸 CO2 當量與市場基準 0 公噸的碳排揭露。
- nanoGPT|karpathy — 以單一 8 張 A100 40GB 節點約四天重現 1.24 億參數的 GPT-2、使用 OpenWebText(WebText 的開源重現版),以及驗證損失約 2.85 的結果。
關於本篇的查證限制:撰寫當下的網路政策擋掉了維基百科、arXiv、IBM、OpenAI、Google 與 Meta 官網、iThome 等網域,只有 GitHub 系與 Anthropic 官方網域能直接讀取。上方四個來源都是直接開啟原文取得。文中「一張顯示卡要跑四千多年」是以模型卡的 3,930 萬 GPU 小時直接換算,不是原文數字。其餘關於訓練成本金額的市場估計(例如各家前沿模型的美元造價)因為無法開啟原始報告核對,本篇一律略過未寫。
整理一下重點:預訓練真的就是一場規模大到誇張的文字接龍練習,它決定了模型懂多少,也決定了它的知識停在哪一天。
希望這一篇有讓你對預訓練有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。