一句話定義

推理模型(Reasoning Model)是會先產生一段內部思考過程、再根據那段過程回答你的 AI 模型。

30 秒看重點

  • 是什麼:推理模型會在回答之前先自己推演一輪,把想法寫出來,再根據那段推演給出最終答案。
  • 為什麼重要:它明顯提升了數學、程式與多步驟問題的正確率,也讓 AI 的算力競賽從「訓練階段」轉移到「回答的當下」。
  • 跟誰相關:常用 AI 解題的學生、要串 API 的工程師、以及在意帳單的產品經理都躲不掉這個詞。
  • 最常見的誤解:很多人以為介面上那段「思考中」就是模型真正的內心小劇場,其實你看到的通常只是摘要。
  • 記住這件事就夠了:它更準、更慢、也更貴,那段沒人看的草稿是要算錢的。

推理模型到底是什麼?

推理模型是一種會先產生內部推演過程、再輸出答案的 AI 模型,跟一般模型「看到問題就直接開口」的作法完全相反。

你是不是也遇過這種狀況:叫 AI 算一題有點繞的數學,它回得超快,語氣超肯定,答案錯得離譜。問題出在一般的大型語言模型是邊講邊生成的,講出第一個字的時候其實還不知道結論長怎樣,等於沒有反悔的機會。

推理模型把這件事拆成兩段。它先花一段時間自言自語,重述題目、試幾條路、算到一半發現不對就換一條,等推演告一段落才開始寫正式答案。就是那種嘴巴會邊唸邊算的同學。Anthropic 在官方文件裡把這個動作講得很直白:一次就要講完的模型沒有草稿空間、沒辦法驗算、也沒辦法中途改路線。

生活比喻:你可以想像成考卷背面那一欄計算區。同樣一題,有人瞄一眼就填答案,有人先在背面把式子列出來、算完再謄上去。推理模型就是後者,而且它草稿寫得又長又細。差別在於考試的草稿紙是免費的,AI 的不是,這件事等一下會講到。

為什麼會有推理模型?

推理模型的出現,是為了解決一般模型「一口氣講完,錯了也回不去」的結構性問題。

問題一:多步驟題目一步錯就全錯。 數學證明、程式除錯、邏輯推演這類任務,中間任何一步歪掉,後面再流暢也是白搭。一般模型沒有停下來檢查的機制。

問題二:難題跟簡單題吃掉一樣的算力。 「今天星期幾」跟「幫我證明這個定理」對一般模型來說成本幾乎一樣,這其實很怪。

推理模型的解法是讓模型在回答當下多花算力,難題就多想一會兒。這條路線 OpenAI 在 2024 年 9 月 12 日推出 o1-preview 時正式帶起來,同年 12 月 5 日完整版 o1 上線;接著 DeepSeek 在 2025 年 1 月 20 日丟出採用 MIT 授權的 DeepSeek-R1,直接把這套能力開源,其他家才一個個跟上。

推理模型是怎麼運作的?

簡單來講就是三個動作:先想、再驗、最後才講。

  1. 產生思考內容:模型先寫出一段只給自己看的推演,重述題目、拆解條件、嘗試解法。
  2. 自我檢查與轉向:算到一半發現路不通,它會回頭換方法,這是一般模型做不到的。
  3. 輸出最終答案:推演結束後才開始寫你看得到的那段回覆。

名詞小教室:這段自言自語的技術名稱叫思考鏈(Chain-of-Thought),意思是把推論過程一步一步攤開來寫。早期是靠人在提示詞裡加一句「請逐步思考」求來的,現在則是直接訓練進模型裡。

老實講,這裡有個很多人沒注意到的細節:那段思考內容是要算錢的。Anthropic 官方文件寫得很明確,思考用掉的 token 以「輸出 token」計價,即使那段文字根本沒回傳給你,而且它還會一起吃掉 max_tokens 的額度。換句話說,你付了草稿紙的錢,卻不一定看得到草稿(這點我覺得滿妙的)。

而且這筆錢不一定是小數目。一道難題的思考內容長度,有可能是最終答案的好幾倍,等於你看到三行回覆,實際上被計價的是三十行。這也是為什麼 Anthropic 的文件會特別提醒開發者去追 usage 裡的 thinking token 欄位,不看那個數字,帳單長出來你會不知道錢花去哪。

推理模型跟一般 LLM 差在哪?

一句話:一般 LLM 是直覺反應,推理模型是先打草稿再作答,兩者不是升級關係而是分工關係。

比較項目推理模型一般 LLM
回答方式先產生內部推演,再寫答案收到問題直接開始生成
速度慢,多等數十秒很常見快,幾乎是即時
費用沒人看的思考過程也按輸出計費只算你看得到的字
擅長的事數學、程式除錯、多步驟推演摘要、翻譯、改寫、閒聊
我會在什麼情況選它答錯成本很高、需要驗算要快、要便宜、任務單純

從這張表可以看出來,選哪個其實是在選「你願意用多少時間跟金錢換正確率」。如果只是請 AI 幫你把一封信改得客氣一點,開推理模型純粹是拿大砲打小鳥,錢燒掉、你還要多等 30 秒。反過來說,要它幫你抓一個卡三天的 bug,那就值得,畢竟你自己的時間比較貴。

你會在哪些 AI 工具看到推理模型?

現在三大廠都把「要不要思考、想多久」做成一個你可以自己轉的旋鈕,只是各家名字不一樣。

  • ChatGPT / OpenAI:用 reasoning_effort 控制深度,分成 low、medium、high 等級。它的思考內容是藏起來的,最多只給你一份摘要,但照樣按輸出 token 收費。
  • Claude / Anthropic:早期是 budget_tokens,可以指定思考的 token 預算,最低 1024、而且必須小於 max_tokens。不過這個寫法在 Claude 4.6 之後被標為淘汰,4.7 以上直接回 400 錯誤,改用會自己判斷要不要思考的 adaptive thinking 搭配 effort 參數 工程師的 migration 通知又多一封
  • Gemini / Google:Gemini 3 改用 thinking_level,值是 minimal、low、medium、high,預設 high,舊的數字型 thinking_budget 官方已經不建議再用。
  • DeepSeek-R1:開源那一支,MIT 授權,想自己架來玩的人可以直接把權重抓下來。

看出來了嗎?三家不約而同從「你自己填幾個 token」改成「選個檔位就好」。順帶一提,這個旋鈕現在也開始影響定價策略,我們在 Gemini 語音模型比價那篇 就提過,Google 把 Extended Thinking 版本單獨拉出來當高階選項賣。

學推理模型最常見的 3 個誤解

  1. 誤解一:推理模型比較聰明,所以什麼都用它就對了 — 真相是它在簡單任務上根本沒優勢,只是讓你等更久、付更多。Apple 在 2025 年 6 月發表的論文《The Illusion of Thinking》還指出,問題複雜到一個程度之後,這類模型的正確率會直接崩掉,而且它明明還有算力沒用完就先放棄了。(不過這篇後來也被同行打臉,有研究認為部分失敗其實是輸出長度限制造成的,不完全是推理能力的問題。)
  2. 誤解二:介面上那段「思考中」就是它真正的內心話 — 真相是你看到的通常是摘要不是原稿。Anthropic 官方文件講得很清楚,thinking 區塊裡的文字是模型推理過程的摘要,而且在 Claude Opus 5、Sonnet 5 這些新模型上預設是完全不顯示的,要自己開。
  3. 誤解三:會思考就不會亂講話了 — 真相是幻覺只會變少,不會消失。多想一輪確實能抓掉一些低級錯誤,可是模型如果一開始就記錯了某個事實,它只是會用更完整的邏輯把錯的答案包裝得更可信而已。

想多了解推理模型,從哪開始?

沒有技術背景的話,最快的方式是拿同一題去問兩次:一次開思考模式、一次關掉,然後比對答案跟等待時間,體感會比看十篇文章都清楚啦。

如果你是工程師,建議直接讀三家的官方 API 文件,重點看兩件事:思考 token 怎麼計價,以及它算不算進 max_tokens。這兩個參數搞錯,帳單跟截斷的回覆會一起來找你 QQ。

另外提醒一件很容易踩的雷:思考設定改了,prompt 快取通常也會跟著失效。Anthropic 文件就直接寫明,budget_tokens 在請求之間改來改去會讓快取斷點失效,因為那個數值本身會被寫進提示裡。所以同一段對話請挑一個檔位用到底,不要一下高一下低,不然你省下來的快取成本會被自己手動歸零。


常見問題 FAQ

推理模型跟 AI 有什麼關係?

推理模型是大型語言模型的一種型態,不是另一種獨立的 AI 技術。它底層一樣是 LLM,差別在於訓練與生成方式讓它會先產生一段內部推演,再輸出最終答案。目前 ChatGPT、Claude、Gemini 的旗艦模型都具備這種能力。

為什麼推理模型突然這麼紅?

關鍵是 2024 年 9 月 12 日 OpenAI 推出 o1-preview,證明了讓模型在回答當下多花算力可以顯著提升解題能力。2025 年 1 月 20 日 DeepSeek 以 MIT 授權釋出 DeepSeek-R1,把這套能力開源,各家廠商隨即全面跟進,推理能力也從賣點變成旗艦模型的標配。

我不是工程師也需要懂推理模型嗎?

如果你會用 AI 工具,了解它對你有兩個實際好處。第一,你會知道什麼時候該切換到思考模式,什麼時候切過去只是浪費時間。第二,你會理解為什麼同一個服務的不同模式價差這麼大,因為你付的是那段看不到的思考過程。

推理模型的中文翻譯有沒有統一?

沒有完全統一,而且很容易跟另一個詞搞混。Reasoning Model 台灣常見譯法是推理模型或思考模型,Inference 則譯為推論,指的是模型訓練完之後拿來回答問題的那段執行過程。兩者英文完全不同,中文卻都有個推字。本站的用法是 Reasoning Model 一律寫推理模型,Inference 一律寫推論。

學會推理模型之後,下一個該學什麼?

建議往三個方向延伸:思考鏈,也就是推理模型背後那套把推論攤開來寫的技巧;推論,理解模型回答你的那段過程實際上在燒什麼資源;還有 Token,因為思考過程的成本就是用它計算的。這三個搞懂,各家模型的定價表大致都看得懂了。


延伸閱讀


參考來源

  1. Extended thinking - Claude Platform Docsbudget_tokens 最低 1024、必須小於 max_tokens、以及在 Claude 4.7 之後被淘汰改用 adaptive thinking 的說明。
  2. Thinking - Claude Platform Docs — 思考 token 以輸出計價、會佔用 max_tokens,以及思考區塊是摘要而非原始推理過程。
  3. Gemini 3 developer guidethinking_level 的四個等級、預設值 high,以及數字型 thinking_budget 已不建議使用。
  4. OpenAI o1(Wikipedia) — o1-preview 於 2024 年 9 月 12 日推出、完整版 12 月 5 日上線的時間軸。
  5. DeepSeek-R1(Hugging Face) — 2025 年 1 月 20 日釋出、採 MIT 授權的開源推理模型。
  6. The Illusion of Thinking - Apple Machine Learning Research — 推理模型在高複雜度問題上正確率崩潰與過度思考的實驗結果。

整理一下重點:推理模型真的不是「比較高級的 AI」,它是拿時間跟錢換正確率的一種選擇,簡單任務開它反而虧。

希望這一篇有讓你對推理模型有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。