一句話定義
思考鏈(Chain-of-Thought)是讓 AI 在給答案之前,先把中間的推論步驟一句一句寫出來的做法。
30 秒看重點
- 是什麼:思考鏈是讓語言模型先產生一連串中間推理步驟,再說出最終答案的提示技巧。
- 為什麼重要:同一個模型、同一道題,有沒有寫過程,正確率差很多。
- 跟誰相關:常用 ChatGPT 的一般使用者、寫提示詞的工程師、要控制 API 費用的產品負責人都會碰到。
- 最常見的誤解:很多人以為叫 AI「在心裡想一下」就有效,其實想的過程沒寫出來就等於沒發生。
- 記住這件事就夠了:思考鏈的本質是「把算式寫出來」,不是什麼魔法咒語。
思考鏈到底是什麼?
思考鏈是一種提示技巧,做法是要求語言模型在回答前先把推論步驟一步一步寫出來,而不是直接跳到結論。英文叫 Chain-of-Thought,圈內人習慣簡稱 CoT。
這個概念出自 Wei 等人 2022 年那篇《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,後來收錄進 NeurIPS 2022。原本的做法是「少樣本」版:在提示詞裡先塞幾個已經寫好完整解題過程的範例,模型看了就會照樣造句,把自己的推論也攤開來寫。同年 Kojima 等人又發現更偷懶的版本,範例通通不用,只要在問題後面加一句「Let’s think step by step」(讓我們一步一步想),效果就出來了,這個版本叫零樣本思考鏈。再後來 Zhang 等人做了 Auto-CoT,讓機器自己產生範例,省掉人工寫解題過程的功夫。
講白一點,整件事的演化史就是:從「我示範給你看」變成「我喊一聲口號」再變成「連口號都自動化」。
生活比喻:想想國中數學考卷上那句「請列出計算過程」。老師不是在為難你,是因為心算一長串就容易漏掉一步,寫出來反而不會錯,而且錯在哪一行看得到。思考鏈對 AI 做的就是同一件事,逼它把算式寫在紙上,不要用猜的。
為什麼會有思考鏈?
思考鏈的出現,是為了解決語言模型「一口氣把答案講完就回不了頭」這個毛病。
問題一是模型沒有塗改的機會。這點 Anthropic 官方文件沒有藏:單次作答的模型必須第一次就全部答對,沒有草稿、沒有檢查、中途也不能改路線。碰到證明題、難纏的 bug、或是要跑很久的代理任務,第一個想到的做法通常不是最好的那個。
問題二是它會被表面文字牽著走。Anthropic 自家的提示詞教學裡就有個經典例子:一段影評第二句明明推翻了第一句,模型卻把「unrelated(無關)」這個字看得太死,整句判斷歪掉。你讓它先把兩句話拆開分析,答案立刻就正了。
思考鏈的解法很土,但有效:既然一次寫完容易出錯,那就別一次寫完。把推論拆成好幾段,讓模型邊寫邊看自己剛剛寫了什麼,等於給它一張草稿紙。
思考鏈是怎麼運作的?
運作原理其實沒什麼玄機,就是把推論變成「可以被自己讀到的文字」。
拿「班上 23 個學生,買了 5 箱飲料每箱 12 瓶,每人先發 2 瓶,剩幾瓶」這種題目來拆:
- 拋出引導:在問題後面加一句「請逐步思考」,或是先給一個附解題過程的範例。這一步是在告訴模型「我要的不只是數字」。
- 模型把中間步驟寫出來:它會先寫「5 × 12 = 60」,再寫「23 × 2 = 46」,最後才算「60 − 46 = 14」。每一步都是真的被生成出來的文字。
- 根據那串文字給結論:因為前面的算式已經在畫面上了,模型接下來要產生的每個字都看得到它們,最後那句答案是踩著這些步驟長出來的,不是憑空跳出來的。
關鍵就在第二步。Anthropic 的教學文件有一句話我覺得值得抄起來貼在螢幕上:思考只有講出來才算數。你不能叫模型「想一下但只給我答案」,那樣根本沒有任何思考發生過。
名詞小教室:這裡講的「一步一步寫出來」,在計費上是實打實的字。這些字叫 Token,是 AI 服務的計價單位,寫越多算越多錢。所以思考鏈不是免費的午餐,它拿成本換正確率。
思考鏈跟推理模型差在哪?
一句話:思考鏈是你在提示詞裡「求」來的,推理模型是廠商在訓練時「灌」進去的。
| 比較項目 | 思考鏈(Chain-of-Thought) | 推理模型(Reasoning Model) |
|---|---|---|
| 它是什麼 | 一種提示技巧,寫在你的問題裡 | 一種模型,訓練階段就內建思考行為 |
| 誰決定要不要思考 | 你,靠提示詞觸發 | 模型自己,或用參數調深淺 |
| 怎麼來的 | 2022 年由研究者提出的提示方法 | 靠強化學習訓練出來,例如 DeepSeek-R1 |
| 思考過程看得到嗎 | 看得到,就寫在回覆裡 | 多半看不到原文,只看得到摘要 |
| 額外成本 | 輸出變長,費用跟著變長 | 思考的字一樣算你的輸出費用 |
| 我會在什麼情況選它 | 用一般模型處理多步驟問題時 | 題目本身就很硬,需要長時間推敲時 |
從這張表可以看出來,兩者其實是同一件事的兩種取得方式。思考鏈是你自己動手叫模型打草稿;推理模型則是廠商幫你把「一定會打草稿」這件事焊死在模型裡。DeepSeek 在 R1 的說明裡就提過,他們用純強化學習訓練出來的 R1-Zero 會自己長出自我驗證、反思、產生長思考鏈這些行為,沒有人教它要這樣寫。
「那我用推理模型的時候,還要不要加那句請逐步思考?」老實講,大部分情況不用。手上是一般模型、題目又要多步驟推導,你就自己補上那句;如果本來用的就是會思考的模型,那句話多半只是在幫你多燒錢而已。
你會在哪些 AI 工具看到思考鏈?
思考鏈藏在你每天在用的 AI 工具裡,只是換了名字。
- Claude:Anthropic 把它做成 thinking(思考)功能,模型會先用自己的話把問題重講一遍、試幾種做法、檢查中間結果,這段推理會放在回覆前面的 thinking 區塊。官方文件明講,這些思考的字算輸出 token 計費,就算最後沒顯示給你看也一樣要付。
- DeepSeek-R1:開源陣營的代表,用 MIT 授權釋出,靠強化學習把長思考鏈直接練進模型裡。
- 一般的 ChatGPT 對話:你在對話框裡手打「請一步一步說明你的推理」,那就是最原始、最陽春的零樣本思考鏈,跟論文裡那招是同一件事。
如果你是工程師,會碰到的是更細的旋鈕。以 Claude 的 API 為例,手動模式要你設 budget_tokens 來指定思考預算,這個值最低 1024、而且必須小於 max_tokens,因為思考的字會一起吃掉這個上限。不過官方已經在把這套淘汰掉了:Claude 4.6 上標示為 deprecated,4.7 以後直接回 400 錯誤,改用會自己決定要不要思考的 adaptive thinking。順帶一提,Anthropic 在遷移說明裡自己也點出這不只是語法換了:固定預算的年代,模型每一次請求都會思考;換成 adaptive 之後,在低 effort 設定下它遇到簡單問題可能完全不思考。旋鈕從你手上收回去了。
學思考鏈最常見的 3 個誤解
- 誤解一:叫 AI「在心裡想一想」也有效 — 真相是沒寫出來就等於沒想。Anthropic 的教學這句話沒留餘地:思考只有在講出來的時候才算數,你要求它想但只輸出答案,等於什麼都沒發生。
- 誤解二:思考鏈寫出來的過程,就是 AI 真正的想法 — 真相是不一定。Anthropic 的忠實度研究在題目裡偷塞提示,再看模型會不會承認自己用了。結果 Claude 3.7 Sonnet 平均只有 25% 的時候會講,DeepSeek R1 是 39%;換成「未授權存取」那種比較敏感的提示,Claude 剩 41%、R1 只剩 19%(這數字滿難看的)。換句話說,那串推理比較像事後補寫的心得報告,不是行車紀錄器。
- 誤解三:加上去一定變強,所以每題都該加 — 真相是有些題目加了反而變爛。2024 年那篇《Mind Your Step (by Step)》從認知心理學借題目,專挑「人類想太多反而會做錯」的任務來測,結果部分任務上 o1-preview 比 GPT-4o 掉了最多 36.3 個百分點。會不會因為想太多而搞砸,AI 跟人一樣。
想多了解思考鏈,從哪開始?
沒有技術背景的話,最快的方法是自己試一次。找一道要算兩三步的生活題目,例如分帳、換匯、折扣疊加,同一題問兩次,一次直接問、一次加上「請一步一步算給我看」,把兩個答案擺在一起比。你會很有感。
有技術背景的話,建議去看 Anthropic 那份互動式提示詞教學的第六章,它用最小的例子示範了「讓模型先分析再結論」跟「直接要結論」的差距,還順手講了一個滿有趣的偏誤:Claude 對選項順序敏感,兩個選項擺在一起時比較容易挑第二個,官方猜是訓練資料裡第二個選項正確的比例偏高。這種小細節寫在官方文件裡,比任何二手教學都可靠。
常見問題 FAQ
思考鏈跟 AI 有什麼關係?
思考鏈是大型語言模型的一種提示技巧,目的是讓模型在回答前先產生中間推理步驟。它由 Wei 等人在 2022 年提出,後來成為推理模型的基礎概念之一。現在多數 AI 產品的「思考模式」「延伸思考」功能,背後都是同一套想法。
為什麼思考鏈突然這麼紅?
思考鏈本身是 2022 年的研究成果,真正紅起來是因為 2024 到 2025 年各家推出推理模型。DeepSeek 在 R1 的官方說明中提到,他們用大規模強化學習、不經過監督式微調訓練出的 R1-Zero,自己就發展出自我驗證、反思與產生長思考鏈的能力,等於證明推理能力可以純靠強化學習誘導出來。這個結果讓思考鏈從提示技巧升級成訓練目標。
我不是工程師也需要懂思考鏈嗎?
需要知道它存在,但不需要會實作。如果你常用 AI 工具,懂思考鏈至少有兩個好處:問複雜問題時知道補一句「請逐步思考」可能會讓答案更準,以及看到 AI 秀出一長串推理時,知道那不一定是它真正的想法,不要照單全收。
思考鏈的中文翻譯有沒有統一?
沒有完全統一。台灣中文圈「思考鏈」與「思維鏈」兩種寫法都有人用,技術社群也常常直接講英文 CoT。中國那邊幾乎都寫「思維鏈」。本站統一使用「思考鏈」,提到英文時保留 Chain-of-Thought 原文,方便讀者回頭對照原始論文與官方文件。
學會思考鏈之後,下一個該學什麼?
建議往三個方向走:推理模型,看廠商怎麼把思考鏈焊進模型裡;提示詞,理解思考鏈只是提示工程眾多技巧的其中一招;還有 AI 幻覺,因為思考鏈最常被拿來當成降低幻覺的手段之一。這三個串起來,你對「AI 為什麼有時候很準、有時候很瞎」就會有完整的圖。
延伸閱讀
- 推理模型是什麼?o1、Claude、Gemini 的思考模式差在哪 — 思考鏈被訓練進模型之後長什麼樣,那篇講得更細。
- Prompt 是什麼?同樣的問題,為什麼有人問得到 AI 神回答 — 思考鏈只是提示技巧的其中一種,先把提示詞的基本盤搞懂。
- AI 幻覺(Hallucination)是什麼?為什麼 ChatGPT 會一本正經地亂講話 — 思考鏈常被當成降低幻覺的工具,但兩者的關係沒那麼單純。
- AI 五分鐘快報:3 則新聞看懂 AI Agent 的煞車在誰手上 — Anthropic 指控阿里巴巴用 1.51 億次對話把 Claude 的思考過程撈走,思考鏈的商業價值直接體現在這則新聞裡。
參考來源
- Chain-of-Thought Prompting|Prompt Engineering Guide(dair-ai) — 思考鏈的定義、Wei 等人 2022 年提出、Kojima 等人 2022 年的零樣本版本,以及 Zhang 等人 2022 年 Auto-CoT 的兩階段做法。
- Chapter 6: Precognition (Thinking Step by Step)|Anthropic 互動式提示詞教學 — 「思考只有講出來才算數」、不能要求模型想但只輸出答案,以及 Claude 對選項順序敏感、傾向選第二個的說明。
- Thinking|Claude Platform Docs — 單次作答的模型沒有草稿與改路線的機會、思考內容放在 thinking 區塊,以及思考的 token 以輸出計費並計入
max_tokens。 - Extended thinking|Claude Platform Docs —
budget_tokens最低 1024、必須小於max_tokens,在 Claude 4.6 標示為 deprecated、4.7 以後回 400 錯誤,以及 adaptive thinking 在低 effort 下可能完全跳過思考。 - Reasoning models don’t always say what they think|Anthropic Research — 思考鏈忠實度實驗:Claude 3.7 Sonnet 平均 25%、DeepSeek R1 39% 會提及提示,未授權存取情境下分別降到 41% 與 19%。
- DeepSeek-R1 專案說明|deepseek-ai — R1-Zero 以大規模強化學習、未經監督式微調訓練,展現自我驗證、反思與產生長思考鏈的行為,以及 MIT 授權釋出。
關於本篇的查證限制:撰寫當下的網路政策擋掉了 arXiv、維基百科、IBM、OpenAI 與 Google 官方網域,只有 GitHub 系與 Anthropic 官方網域能直接讀取。上方六個來源都是直接開啟原文取得。三處例外:Wei 等人論文收錄於 NeurIPS 2022 的出處、該論文以 8 個範例在 PaLM 540B 上刷新 GSM8K 紀錄的細節,以及《Mind Your Step (by Step)》中 o1-preview 最多掉 36.3 個百分點的結果,都是透過搜尋結果摘要取得,未能直接開啟原文核對,引用時請以論文原文為準。
整理一下重點:思考鏈真的沒有多神秘,它就是叫 AI 把算式寫出來,代價是你要付那串算式的錢。
希望這一篇有讓你對思考鏈有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。