一句話定義
推理模型(Reasoning Model)是會先產生一段內部思考過程、再根據那段過程回答你的 AI 模型。
30 秒看重點
- 是什麼:推理模型會在回答之前先自己推演一輪,把想法寫出來,再根據那段推演給出最終答案。
- 為什麼重要:它明顯提升了數學、程式與多步驟問題的正確率,也讓 AI 的算力競賽從「訓練階段」轉移到「回答的當下」。
- 跟誰相關:常用 AI 解題的學生、要串 API 的工程師、以及在意帳單的產品經理都躲不掉這個詞。
- 最常見的誤解:很多人以為介面上那段「思考中」就是模型真正的內心小劇場,其實你看到的通常只是摘要。
- 記住這件事就夠了:它更準、更慢、也更貴,那段沒人看的草稿是要算錢的。
推理模型到底是什麼?
推理模型是一種會先產生內部推演過程、再輸出答案的 AI 模型,跟一般模型「看到問題就直接開口」的作法完全相反。
你是不是也遇過這種狀況:叫 AI 算一題有點繞的數學,它回得超快,語氣超肯定,答案錯得離譜。問題出在一般的大型語言模型是邊講邊生成的,講出第一個字的時候其實還不知道結論長怎樣,等於沒有反悔的機會。
推理模型把這件事拆成兩段。它先花一段時間自言自語,重述題目、試幾條路、算到一半發現不對就換一條,等推演告一段落才開始寫正式答案。就是那種嘴巴會邊唸邊算的同學。Anthropic 在官方文件裡把這個動作講得很直白:一次就要講完的模型沒有草稿空間、沒辦法驗算、也沒辦法中途改路線。
生活比喻:你可以想像成考卷背面那一欄計算區。同樣一題,有人瞄一眼就填答案,有人先在背面把式子列出來、算完再謄上去。推理模型就是後者,而且它草稿寫得又長又細。差別在於考試的草稿紙是免費的,AI 的不是,這件事等一下會講到。
為什麼會有推理模型?
推理模型的出現,是為了解決一般模型「一口氣講完,錯了也回不去」的結構性問題。
問題一:多步驟題目一步錯就全錯。 數學證明、程式除錯、邏輯推演這類任務,中間任何一步歪掉,後面再流暢也是白搭。一般模型沒有停下來檢查的機制。
問題二:難題跟簡單題吃掉一樣的算力。 「今天星期幾」跟「幫我證明這個定理」對一般模型來說成本幾乎一樣,這其實很怪。
推理模型的解法是讓模型在回答當下多花算力,難題就多想一會兒。這條路線 OpenAI 在 2024 年 9 月 12 日推出 o1-preview 時正式帶起來,同年 12 月 5 日完整版 o1 上線;接著 DeepSeek 在 2025 年 1 月 20 日丟出採用 MIT 授權的 DeepSeek-R1,直接把這套能力開源,其他家才一個個跟上。
推理模型是怎麼運作的?
簡單來講就是三個動作:先想、再驗、最後才講。
- 產生思考內容:模型先寫出一段只給自己看的推演,重述題目、拆解條件、嘗試解法。
- 自我檢查與轉向:算到一半發現路不通,它會回頭換方法,這是一般模型做不到的。
- 輸出最終答案:推演結束後才開始寫你看得到的那段回覆。
名詞小教室:這段自言自語的技術名稱叫思考鏈(Chain-of-Thought),意思是把推論過程一步一步攤開來寫。早期是靠人在提示詞裡加一句「請逐步思考」求來的,現在則是直接訓練進模型裡。
老實講,這裡有個很多人沒注意到的細節:那段思考內容是要算錢的。Anthropic 官方文件寫得很明確,思考用掉的 token 以「輸出 token」計價,即使那段文字根本沒回傳給你,而且它還會一起吃掉 max_tokens 的額度。換句話說,你付了草稿紙的錢,卻不一定看得到草稿(這點我覺得滿妙的)。
而且這筆錢不一定是小數目。一道難題的思考內容長度,有可能是最終答案的好幾倍,等於你看到三行回覆,實際上被計價的是三十行。這也是為什麼 Anthropic 的文件會特別提醒開發者去追 usage 裡的 thinking token 欄位,不看那個數字,帳單長出來你會不知道錢花去哪。
推理模型跟一般 LLM 差在哪?
一句話:一般 LLM 是直覺反應,推理模型是先打草稿再作答,兩者不是升級關係而是分工關係。
| 比較項目 | 推理模型 | 一般 LLM |
|---|---|---|
| 回答方式 | 先產生內部推演,再寫答案 | 收到問題直接開始生成 |
| 速度 | 慢,多等數十秒很常見 | 快,幾乎是即時 |
| 費用 | 沒人看的思考過程也按輸出計費 | 只算你看得到的字 |
| 擅長的事 | 數學、程式除錯、多步驟推演 | 摘要、翻譯、改寫、閒聊 |
| 我會在什麼情況選它 | 答錯成本很高、需要驗算 | 要快、要便宜、任務單純 |
從這張表可以看出來,選哪個其實是在選「你願意用多少時間跟金錢換正確率」。如果只是請 AI 幫你把一封信改得客氣一點,開推理模型純粹是拿大砲打小鳥,錢燒掉、你還要多等 30 秒。反過來說,要它幫你抓一個卡三天的 bug,那就值得,畢竟你自己的時間比較貴。
你會在哪些 AI 工具看到推理模型?
現在三大廠都把「要不要思考、想多久」做成一個你可以自己轉的旋鈕,只是各家名字不一樣。
- ChatGPT / OpenAI:用
reasoning_effort控制深度,分成 low、medium、high 等級。它的思考內容是藏起來的,最多只給你一份摘要,但照樣按輸出 token 收費。 - Claude / Anthropic:早期是
budget_tokens,可以指定思考的 token 預算,最低 1024、而且必須小於max_tokens。不過這個寫法在 Claude 4.6 之後被標為淘汰,4.7 以上直接回 400 錯誤,改用會自己判斷要不要思考的 adaptive thinking 搭配 effort 參數工程師的 migration 通知又多一封。 - Gemini / Google:Gemini 3 改用
thinking_level,值是 minimal、low、medium、high,預設 high,舊的數字型thinking_budget官方已經不建議再用。 - DeepSeek-R1:開源那一支,MIT 授權,想自己架來玩的人可以直接把權重抓下來。
看出來了嗎?三家不約而同從「你自己填幾個 token」改成「選個檔位就好」。順帶一提,這個旋鈕現在也開始影響定價策略,我們在 Gemini 語音模型比價那篇 就提過,Google 把 Extended Thinking 版本單獨拉出來當高階選項賣。
學推理模型最常見的 3 個誤解
- 誤解一:推理模型比較聰明,所以什麼都用它就對了 — 真相是它在簡單任務上根本沒優勢,只是讓你等更久、付更多。Apple 在 2025 年 6 月發表的論文《The Illusion of Thinking》還指出,問題複雜到一個程度之後,這類模型的正確率會直接崩掉,而且它明明還有算力沒用完就先放棄了。(不過這篇後來也被同行打臉,有研究認為部分失敗其實是輸出長度限制造成的,不完全是推理能力的問題。)
- 誤解二:介面上那段「思考中」就是它真正的內心話 — 真相是你看到的通常是摘要不是原稿。Anthropic 官方文件講得很清楚,thinking 區塊裡的文字是模型推理過程的摘要,而且在 Claude Opus 5、Sonnet 5 這些新模型上預設是完全不顯示的,要自己開。
- 誤解三:會思考就不會亂講話了 — 真相是幻覺只會變少,不會消失。多想一輪確實能抓掉一些低級錯誤,可是模型如果一開始就記錯了某個事實,它只是會用更完整的邏輯把錯的答案包裝得更可信而已。
想多了解推理模型,從哪開始?
沒有技術背景的話,最快的方式是拿同一題去問兩次:一次開思考模式、一次關掉,然後比對答案跟等待時間,體感會比看十篇文章都清楚啦。
如果你是工程師,建議直接讀三家的官方 API 文件,重點看兩件事:思考 token 怎麼計價,以及它算不算進 max_tokens。這兩個參數搞錯,帳單跟截斷的回覆會一起來找你 QQ。
另外提醒一件很容易踩的雷:思考設定改了,prompt 快取通常也會跟著失效。Anthropic 文件就直接寫明,budget_tokens 在請求之間改來改去會讓快取斷點失效,因為那個數值本身會被寫進提示裡。所以同一段對話請挑一個檔位用到底,不要一下高一下低,不然你省下來的快取成本會被自己手動歸零。
常見問題 FAQ
推理模型跟 AI 有什麼關係?
推理模型是大型語言模型的一種型態,不是另一種獨立的 AI 技術。它底層一樣是 LLM,差別在於訓練與生成方式讓它會先產生一段內部推演,再輸出最終答案。目前 ChatGPT、Claude、Gemini 的旗艦模型都具備這種能力。
為什麼推理模型突然這麼紅?
關鍵是 2024 年 9 月 12 日 OpenAI 推出 o1-preview,證明了讓模型在回答當下多花算力可以顯著提升解題能力。2025 年 1 月 20 日 DeepSeek 以 MIT 授權釋出 DeepSeek-R1,把這套能力開源,各家廠商隨即全面跟進,推理能力也從賣點變成旗艦模型的標配。
我不是工程師也需要懂推理模型嗎?
如果你會用 AI 工具,了解它對你有兩個實際好處。第一,你會知道什麼時候該切換到思考模式,什麼時候切過去只是浪費時間。第二,你會理解為什麼同一個服務的不同模式價差這麼大,因為你付的是那段看不到的思考過程。
推理模型的中文翻譯有沒有統一?
沒有完全統一,而且很容易跟另一個詞搞混。Reasoning Model 台灣常見譯法是推理模型或思考模型,Inference 則譯為推論,指的是模型訓練完之後拿來回答問題的那段執行過程。兩者英文完全不同,中文卻都有個推字。本站的用法是 Reasoning Model 一律寫推理模型,Inference 一律寫推論。
學會推理模型之後,下一個該學什麼?
建議往三個方向延伸:思考鏈,也就是推理模型背後那套把推論攤開來寫的技巧;推論,理解模型回答你的那段過程實際上在燒什麼資源;還有 Token,因為思考過程的成本就是用它計算的。這三個搞懂,各家模型的定價表大致都看得懂了。
延伸閱讀
- AI 推論(Inference)是什麼? — 最容易跟推理模型搞混的詞,先分清楚這兩個再往下讀。
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — 推理模型的底層就是它,這篇補齊基礎。
- AI 的 Token 是什麼? — 思考過程的計費單位,看懂它才看得懂帳單。
- Gemini 語音便宜 4 成等 3 大趨勢 — Google 把 Extended Thinking 版本當高階選項賣的實例。
參考來源
- Extended thinking - Claude Platform Docs —
budget_tokens最低 1024、必須小於max_tokens、以及在 Claude 4.7 之後被淘汰改用 adaptive thinking 的說明。 - Thinking - Claude Platform Docs — 思考 token 以輸出計價、會佔用
max_tokens,以及思考區塊是摘要而非原始推理過程。 - Gemini 3 developer guide —
thinking_level的四個等級、預設值 high,以及數字型thinking_budget已不建議使用。 - OpenAI o1(Wikipedia) — o1-preview 於 2024 年 9 月 12 日推出、完整版 12 月 5 日上線的時間軸。
- DeepSeek-R1(Hugging Face) — 2025 年 1 月 20 日釋出、採 MIT 授權的開源推理模型。
- The Illusion of Thinking - Apple Machine Learning Research — 推理模型在高複雜度問題上正確率崩潰與過度思考的實驗結果。
整理一下重點:推理模型真的不是「比較高級的 AI」,它是拿時間跟錢換正確率的一種選擇,簡單任務開它反而虧。
希望這一篇有讓你對推理模型有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。