一句話定義
Transformer 是一種完全靠注意力機制、不靠遞迴逐字傳遞的神經網路架構,能把整段輸入一次平行讀完,是現在幾乎所有主流 AI 模型的底層骨架。
30 秒看重點
- 是什麼:Transformer 把「一個字傳一個字」的舊做法整組拿掉,改成整句話攤開來、每個字自己去比對其他字。
- 為什麼重要:它讓訓練可以平行化,模型才有辦法愈養愈大,ChatGPT、Claude、Gemini 都是它的後代。
- 跟誰相關:想看懂 AI 新聞的一般讀者、會碰模型的工程師,還有每個要編顯示卡預算的人。
- 最常見的誤解:很多人以為 Transformer 是某個模型的名字,其實它是一種架構,不是一顆模型。
- 記住這件事就夠了:Transformer 賣的不是更聰明,是更能平行運算,剩下的規模化是因為這件事才發生的。
Transformer 到底是什麼?
Transformer 是 2017 年〈Attention Is All You Need〉這篇論文提出的神經網路架構,特色是完全不用遞迴(recurrence),只靠注意力機制就把整段輸入處理完。Harvard NLP 的《The Annotated Transformer》直接寫明,它是「第一個完全依賴自注意力來計算表示、不使用序列對齊的 RNN 或卷積的轉導模型」。
先講最容易搞混的一件事:Transformer 不是產品,是骨架。就像不同品牌的車可以共用同一種引擎設計,ChatGPT、Claude、Gemini 是不同公司的不同模型,但底層的結構圖長得很像。
原始版本長什麼樣子?論文那組數字其實小得可愛:編碼器與解碼器各堆 6 層,模型維度 512,8 個注意力頭、每個頭 64 維,前饋層 2048,dropout 0.1。拿今天動不動幾千億參數的模型來對照,這組數字看起來有點不真實(真的有夠迷你)。
生活比喻:你可以想像成一個傳話遊戲。舊的 RNN 是排成一列,第一個人聽完悄悄話傳給第二個、第二個傳給第三個,傳到第 30 個人的時候,開頭那句話早就走樣了,而且不管你找幾個人幫忙,隊伍還是只能一個一個傳。Transformer 直接把遊戲規則改掉:把整句話印出來貼在白板上,全班同時抬頭看,誰跟誰有關係自己去對。傳話遊戲的隊伍消失了,這就是它最狠的地方。
為什麼會有 Transformer?
因為在它之前主流的 RNN 有兩個治不好的毛病,Hugging Face 官方那篇〈Transformer-based Encoder-Decoder Models〉寫得很直接:一是梯度消失,讓模型很難學會離很遠的兩個字之間的關係;二是循序處理沒辦法平行化,現代硬體的算力根本吃不滿。
問題一是距離。 一句話開頭出現「阿明」、結尾出現「他」,中間隔了 40 個字,傳話遊戲傳到那邊就模糊了。
問題二是速度。 RNN 得等前一個字算完才能算下一個字,顯示卡核心再多也只能排隊乾等。買了頂規顯卡結果在排隊
Transformer 的解法是把「順序」這件事從計算流程裡拿掉,改成矩陣一次算完,再另外補位置資訊回去。效果有多大?論文的基礎模型在一台 8 顆 NVIDIA P100 的機器上,每步約 0.4 秒、跑 10 萬步大約 12 小時,就在 WMT 2014 英德翻譯拿到 28.4 BLEU。Google Brain 的 Tensor2Tensor 專案文件也建議,翻譯任務直接用 --model=transformer,8 張 GPU 跑 30 萬步大約就能到 28 BLEU,「接近當時的最佳水準」。
Transformer 是怎麼運作的?
一段文字進來,會依序經過切詞、別號碼牌、互相比對三個動作,而且是整段一起做,不是一個字一個字來。
- 切成 token 再轉成向量:文字先被切成一塊一塊的 token,每塊變成一組數字,模型才讀得懂。
- 加上位置編碼:整句話攤開來看有個副作用,先後順序不見了。所以要幫每個位置別一張號碼牌,論文用的是 sin 與 cos 函數算出來的位置編碼。
- 多頭自注意力 + 前饋層:每個字跟句子裡所有字比一輪關聯度,照關聯度加權吸收資訊,再送進前饋層整理,這樣的區塊疊 N 層。
名詞小教室:自注意力(self-attention) 就是「一句話自己跟自己對照一遍」。論文的原版用了 8 個頭,你可以想成同一句話派 8 組人各看各的角度,有人盯文法、有人盯語意,最後把 8 份筆記合起來。這塊是整個架構的心臟,細節可以看注意力機制(Attention)是什麼?那篇。
Transformer 跟 RNN 差在哪?
一句話:RNN 是排隊傳話,Transformer 是全班同時看白板,準確度的差距是結果,能不能平行運算才是原因。
| 比較項目 | Transformer | RNN / LSTM |
|---|---|---|
| 讀取方式 | 整段一次平行處理 | 一個 token 接一個,循序處理 |
| 長距離關係 | 任兩個位置直接對上,距離不影響 | 距離愈遠訊號愈弱,梯度容易消失 |
| 能不能吃滿 GPU | 可以,矩陣運算一次算完 | 不行,前一步沒算完就得等 |
| 運算成本 | 每個位置都要跟所有位置比一輪,長度變兩倍成本變四倍 | 隨長度一步一步累加 |
| 2026 年的主流程度 | 主流模型幾乎清一色是它 | 已經不是主流 |
從這張表可以看出來,Transformer 並不是每一格都贏。句子一長,「每個字都要跟每個字比」這件事的成本就跳得很兇,這也是為什麼各家的上下文視窗愈開愈大、價格卻愈來愈需要精算。老實講,這半邊很少出現在發表會的投影片上。
你會在哪些 AI 工具看到 Transformer?
答案是你每天在用的那幾個,而且它們用的是 Transformer 的三種不同切法。
- 只留編碼器(encoder-only):Google 在 2018 年 10 月發表的 BERT,全名就叫 Bidirectional Encoder Representations from Transformers。它把輸入裡 15% 的字遮起來讓模型猜,Base 版 12 層、1.1 億參數,Large 版 24 層、3.4 億參數,在 SQuAD v1.1 拿到 91.8 的 F1。這一派只讀不寫,強項是把整句話的意思吃透,不是生成新句子。
- 只留解碼器(decoder-only):走單向自注意力,只看得到前面已經出現的字,一次吐一個 token。市面上會跟你一路聊下去的生成式模型多半屬於這一派。
- 編碼器加解碼器:T5、BART、Pegasus 這類翻譯與摘要模型,還有 OpenAI 的語音模型 Whisper,官方文件寫明它是「Transformer 序列對序列模型」,最大版 15.5 億參數,能同時做多語言辨識、翻譯與語言判定。
它甚至早就跑出文字圈了。Google Research 的 Vision Transformer 把圖片切成固定大小的方塊、每塊當成一個 token 餵進標準 Transformer 編碼器,論文名字取得很傳神,叫〈An Image is Worth 16x16 Words〉。如果你是工程師,最快的入口是 Hugging Face 的 transformers 套件,官方說明寫著 Hub 上有超過一百萬個模型檢查點,涵蓋文字、影像、音訊、影片與多模態。
學 Transformer 最常見的 3 個誤解
- 誤解一:Transformer 是一個模型 — 真相是它是架構,不是模型。「那 GPT 跟 Transformer 是競爭關係嗎?」不是,GPT 是蓋在 Transformer 上的其中一種蓋法,就像問「大樓跟鋼骨結構誰比較強」一樣怪。
- 誤解二:注意力機制是 Transformer 發明的 — 真相是我們在注意力機制那篇提過,它 2015 年就在 RNN 翻譯模型裡上工了,比 Transformer 早兩年。論文標題叫〈Attention Is All You Need〉,意思是「只留注意力就夠了」,重點在那個 All,不在 Attention。
- 誤解三:它已經過時了 — 真相是 2026 年的主流模型還是 Transformer。MoE、長上下文、推理模型這些新聞熱詞,改的多半是它的某一層或某個模組,地基沒換。畢竟一個 2017 年的設計撐到現在,這件事本身就滿不尋常的。
想多了解 Transformer,從哪開始?
沒有技術背景的話,記住「攤開來一次讀完」這個畫面就夠用了。下次看到新聞說某模型「上下文視窗更大」「推論更便宜」,你就知道那是在同一個地基上換零件,不是重蓋。
有技術背景的話,直接讀 Harvard NLP 的《The Annotated Transformer》,它把論文逐段對照 PyTorch 程式碼,6 層、512 維、8 個頭這些數字都能在程式裡找到對應位置。想動手就裝 Hugging Face transformers,從一顆小的 encoder-only 模型開始玩最省事。
常見問題 FAQ
Transformer 跟 AI 有什麼關係?
Transformer 是目前絕大多數 AI 模型的底層架構。它在 2017 年的論文〈Attention Is All You Need〉中提出,完全以注意力機制取代遞迴結構,讓模型可以平行處理整段輸入。ChatGPT、Claude、Gemini 等大型語言模型,以及 BERT、Whisper、Vision Transformer 等模型,都建立在這個架構之上。
為什麼 Transformer 這麼重要?
因為它解決了 RNN 無法平行運算與難以處理長距離依賴這兩個問題。平行化讓訓練規模得以大幅擴張,模型參數從數億成長到數千億,才有了今天的生成式 AI。原始論文的基礎模型只用一台八顆 NVIDIA P100 GPU 的機器訓練約十二小時,就在 WMT 2014 英德翻譯任務達到 28.4 BLEU。
我不是工程師也需要懂 Transformer 嗎?
如果你會看 AI 新聞,懂 Transformer 可以幫你分辨哪些消息是真的架構突破、哪些只是同一個架構上的調整。多數所謂的新技術,例如混合專家模型、更長的上下文視窗、推理模型,改的都是 Transformer 的局部模組,而不是換掉整個地基。
Transformer 的中文翻譯有沒有統一?
沒有統一,而且這個詞在台灣最常見的做法是直接講英文。中文圈的譯法包括「變換器架構」與「轉換器架構」,本站行文一律使用原文 Transformer,只在需要時標註「變換器架構」。要特別避免譯成「變壓器」,那是電力設備的譯名,用在 AI 情境會誤導讀者。
學會 Transformer 之後,下一個該學什麼?
建議往三個方向延伸:注意力機制,也就是 Transformer 內部真正做事的那個零件;Token,理解文字如何被切成模型看得懂的單位;還有混合專家模型,那是近年在 Transformer 上最主流的改法。這三個搞懂,大部分模型規格表都讀得動了。
延伸閱讀
- 注意力機制(Attention)是什麼?一次搞懂 AI 讀懂上下文的關鍵設計 — Transformer 拿掉遞迴之後剩下的核心零件,Q、K、V 在幹嘛都在這篇。
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — Transformer 是骨架,LLM 是蓋在骨架上的成品。
- MoE 是什麼?混合專家模型怎麼讓大模型只花小模型的算力 — 近年最主流的 Transformer 改法,動的是前饋層那一塊。
- AI 的 Token 是什麼? — 文字要先切成 token 才進得了 Transformer,這是流程的第一步。
- Transformer 之父跳槽 OpenAI 等 4 大動態 — 論文共同作者 Noam Shazeer 離開 Google DeepMind 加入 OpenAI 的來龍去脈。
參考來源
- The Annotated Transformer|harvardnlp — 論文原文逐段對照程式碼,本文的 6 層、d_model 512、8 個注意力頭、d_ff 2048、dropout 0.1、sin/cos 位置編碼、「第一個完全依賴自注意力的轉導模型」,以及 8 顆 P100、每步 0.4 秒、10 萬步約 12 小時、28.4 BLEU 都出自這裡。
- Tensor2Tensor 官方 README|tensorflow — 由 Google Brain 團隊開發、現已停止維護;翻譯任務建議使用
--model=transformer,8 張 GPU 跑 30 萬步約可達 28 BLEU。 - Transformer-based Encoder-Decoder Models|Hugging Face Blog — RNN 的梯度消失與無法平行化兩大限制、編碼器雙向自注意力與解碼器單向自注意力加交叉注意力的分工,以及 T5、BART、Pegasus 等代表模型。
- BERT 官方 README|google-research — BERT 全名、2018 年 10 月發表、遮蔽 15% 字詞的預訓練方式、Base 12 層 1.1 億參數與 Large 24 層 3.4 億參數、SQuAD v1.1 的 91.8 F1。
- Whisper 官方 README|openai — Whisper 是 Transformer 序列對序列模型,large 版 15.5 億參數,支援多語言辨識、語音翻譯與語言判定。
- Vision Transformer 官方 README|google-research — 〈An Image is Worth 16x16 Words〉論文、把圖片切成固定大小方塊後餵進標準 Transformer 編碼器的做法。
- transformers 官方 README|huggingface — Hugging Face Hub 上超過一百萬個模型檢查點,涵蓋文字、影像、音訊、影片與多模態。
整理一下重點:Transformer 真的就是「把整句話攤開來一次讀完」這一招,它換來的不是更聰明,是能平行運算,後面那些愈養愈大的模型全是這招的副產品。
希望這一篇有讓你對 Transformer 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。