一句話定義

Transformer 是一種完全靠注意力機制、不靠遞迴逐字傳遞的神經網路架構,能把整段輸入一次平行讀完,是現在幾乎所有主流 AI 模型的底層骨架。

30 秒看重點

  • 是什麼:Transformer 把「一個字傳一個字」的舊做法整組拿掉,改成整句話攤開來、每個字自己去比對其他字。
  • 為什麼重要:它讓訓練可以平行化,模型才有辦法愈養愈大,ChatGPT、Claude、Gemini 都是它的後代。
  • 跟誰相關:想看懂 AI 新聞的一般讀者、會碰模型的工程師,還有每個要編顯示卡預算的人。
  • 最常見的誤解:很多人以為 Transformer 是某個模型的名字,其實它是一種架構,不是一顆模型。
  • 記住這件事就夠了:Transformer 賣的不是更聰明,是更能平行運算,剩下的規模化是因為這件事才發生的。

Transformer 到底是什麼?

Transformer 是 2017 年〈Attention Is All You Need〉這篇論文提出的神經網路架構,特色是完全不用遞迴(recurrence),只靠注意力機制就把整段輸入處理完。Harvard NLP 的《The Annotated Transformer》直接寫明,它是「第一個完全依賴自注意力來計算表示、不使用序列對齊的 RNN 或卷積的轉導模型」。

先講最容易搞混的一件事:Transformer 不是產品,是骨架。就像不同品牌的車可以共用同一種引擎設計,ChatGPT、Claude、Gemini 是不同公司的不同模型,但底層的結構圖長得很像。

原始版本長什麼樣子?論文那組數字其實小得可愛:編碼器與解碼器各堆 6 層,模型維度 512,8 個注意力頭、每個頭 64 維,前饋層 2048,dropout 0.1。拿今天動不動幾千億參數的模型來對照,這組數字看起來有點不真實(真的有夠迷你)。

生活比喻:你可以想像成一個傳話遊戲。舊的 RNN 是排成一列,第一個人聽完悄悄話傳給第二個、第二個傳給第三個,傳到第 30 個人的時候,開頭那句話早就走樣了,而且不管你找幾個人幫忙,隊伍還是只能一個一個傳。Transformer 直接把遊戲規則改掉:把整句話印出來貼在白板上,全班同時抬頭看,誰跟誰有關係自己去對。傳話遊戲的隊伍消失了,這就是它最狠的地方。

為什麼會有 Transformer?

因為在它之前主流的 RNN 有兩個治不好的毛病,Hugging Face 官方那篇〈Transformer-based Encoder-Decoder Models〉寫得很直接:一是梯度消失,讓模型很難學會離很遠的兩個字之間的關係;二是循序處理沒辦法平行化,現代硬體的算力根本吃不滿。

問題一是距離。 一句話開頭出現「阿明」、結尾出現「他」,中間隔了 40 個字,傳話遊戲傳到那邊就模糊了。

問題二是速度。 RNN 得等前一個字算完才能算下一個字,顯示卡核心再多也只能排隊乾等。買了頂規顯卡結果在排隊

Transformer 的解法是把「順序」這件事從計算流程裡拿掉,改成矩陣一次算完,再另外補位置資訊回去。效果有多大?論文的基礎模型在一台 8 顆 NVIDIA P100 的機器上,每步約 0.4 秒、跑 10 萬步大約 12 小時,就在 WMT 2014 英德翻譯拿到 28.4 BLEU。Google Brain 的 Tensor2Tensor 專案文件也建議,翻譯任務直接用 --model=transformer,8 張 GPU 跑 30 萬步大約就能到 28 BLEU,「接近當時的最佳水準」。

Transformer 是怎麼運作的?

一段文字進來,會依序經過切詞、別號碼牌、互相比對三個動作,而且是整段一起做,不是一個字一個字來。

  1. 切成 token 再轉成向量:文字先被切成一塊一塊的 token,每塊變成一組數字,模型才讀得懂。
  2. 加上位置編碼:整句話攤開來看有個副作用,先後順序不見了。所以要幫每個位置別一張號碼牌,論文用的是 sin 與 cos 函數算出來的位置編碼。
  3. 多頭自注意力 + 前饋層:每個字跟句子裡所有字比一輪關聯度,照關聯度加權吸收資訊,再送進前饋層整理,這樣的區塊疊 N 層。

名詞小教室自注意力(self-attention) 就是「一句話自己跟自己對照一遍」。論文的原版用了 8 個頭,你可以想成同一句話派 8 組人各看各的角度,有人盯文法、有人盯語意,最後把 8 份筆記合起來。這塊是整個架構的心臟,細節可以看注意力機制(Attention)是什麼?那篇。

Transformer 跟 RNN 差在哪?

一句話:RNN 是排隊傳話,Transformer 是全班同時看白板,準確度的差距是結果,能不能平行運算才是原因。

比較項目TransformerRNN / LSTM
讀取方式整段一次平行處理一個 token 接一個,循序處理
長距離關係任兩個位置直接對上,距離不影響距離愈遠訊號愈弱,梯度容易消失
能不能吃滿 GPU可以,矩陣運算一次算完不行,前一步沒算完就得等
運算成本每個位置都要跟所有位置比一輪,長度變兩倍成本變四倍隨長度一步一步累加
2026 年的主流程度主流模型幾乎清一色是它已經不是主流

從這張表可以看出來,Transformer 並不是每一格都贏。句子一長,「每個字都要跟每個字比」這件事的成本就跳得很兇,這也是為什麼各家的上下文視窗愈開愈大、價格卻愈來愈需要精算。老實講,這半邊很少出現在發表會的投影片上。

你會在哪些 AI 工具看到 Transformer?

答案是你每天在用的那幾個,而且它們用的是 Transformer 的三種不同切法。

  • 只留編碼器(encoder-only):Google 在 2018 年 10 月發表的 BERT,全名就叫 Bidirectional Encoder Representations from Transformers。它把輸入裡 15% 的字遮起來讓模型猜,Base 版 12 層、1.1 億參數,Large 版 24 層、3.4 億參數,在 SQuAD v1.1 拿到 91.8 的 F1。這一派只讀不寫,強項是把整句話的意思吃透,不是生成新句子。
  • 只留解碼器(decoder-only):走單向自注意力,只看得到前面已經出現的字,一次吐一個 token。市面上會跟你一路聊下去的生成式模型多半屬於這一派。
  • 編碼器加解碼器:T5、BART、Pegasus 這類翻譯與摘要模型,還有 OpenAI 的語音模型 Whisper,官方文件寫明它是「Transformer 序列對序列模型」,最大版 15.5 億參數,能同時做多語言辨識、翻譯與語言判定。

它甚至早就跑出文字圈了。Google Research 的 Vision Transformer 把圖片切成固定大小的方塊、每塊當成一個 token 餵進標準 Transformer 編碼器,論文名字取得很傳神,叫〈An Image is Worth 16x16 Words〉。如果你是工程師,最快的入口是 Hugging Face 的 transformers 套件,官方說明寫著 Hub 上有超過一百萬個模型檢查點,涵蓋文字、影像、音訊、影片與多模態。

學 Transformer 最常見的 3 個誤解

  1. 誤解一:Transformer 是一個模型 — 真相是它是架構,不是模型。「那 GPT 跟 Transformer 是競爭關係嗎?」不是,GPT 是蓋在 Transformer 上的其中一種蓋法,就像問「大樓跟鋼骨結構誰比較強」一樣怪。
  2. 誤解二:注意力機制是 Transformer 發明的 — 真相是我們在注意力機制那篇提過,它 2015 年就在 RNN 翻譯模型裡上工了,比 Transformer 早兩年。論文標題叫〈Attention Is All You Need〉,意思是「只留注意力就夠了」,重點在那個 All,不在 Attention。
  3. 誤解三:它已經過時了 — 真相是 2026 年的主流模型還是 Transformer。MoE、長上下文、推理模型這些新聞熱詞,改的多半是它的某一層或某個模組,地基沒換。畢竟一個 2017 年的設計撐到現在,這件事本身就滿不尋常的。

想多了解 Transformer,從哪開始?

沒有技術背景的話,記住「攤開來一次讀完」這個畫面就夠用了。下次看到新聞說某模型「上下文視窗更大」「推論更便宜」,你就知道那是在同一個地基上換零件,不是重蓋。

有技術背景的話,直接讀 Harvard NLP 的《The Annotated Transformer》,它把論文逐段對照 PyTorch 程式碼,6 層、512 維、8 個頭這些數字都能在程式裡找到對應位置。想動手就裝 Hugging Face transformers,從一顆小的 encoder-only 模型開始玩最省事。


常見問題 FAQ

Transformer 跟 AI 有什麼關係?

Transformer 是目前絕大多數 AI 模型的底層架構。它在 2017 年的論文〈Attention Is All You Need〉中提出,完全以注意力機制取代遞迴結構,讓模型可以平行處理整段輸入。ChatGPT、Claude、Gemini 等大型語言模型,以及 BERT、Whisper、Vision Transformer 等模型,都建立在這個架構之上。

為什麼 Transformer 這麼重要?

因為它解決了 RNN 無法平行運算與難以處理長距離依賴這兩個問題。平行化讓訓練規模得以大幅擴張,模型參數從數億成長到數千億,才有了今天的生成式 AI。原始論文的基礎模型只用一台八顆 NVIDIA P100 GPU 的機器訓練約十二小時,就在 WMT 2014 英德翻譯任務達到 28.4 BLEU。

我不是工程師也需要懂 Transformer 嗎?

如果你會看 AI 新聞,懂 Transformer 可以幫你分辨哪些消息是真的架構突破、哪些只是同一個架構上的調整。多數所謂的新技術,例如混合專家模型、更長的上下文視窗、推理模型,改的都是 Transformer 的局部模組,而不是換掉整個地基。

Transformer 的中文翻譯有沒有統一?

沒有統一,而且這個詞在台灣最常見的做法是直接講英文。中文圈的譯法包括「變換器架構」與「轉換器架構」,本站行文一律使用原文 Transformer,只在需要時標註「變換器架構」。要特別避免譯成「變壓器」,那是電力設備的譯名,用在 AI 情境會誤導讀者。

學會 Transformer 之後,下一個該學什麼?

建議往三個方向延伸:注意力機制,也就是 Transformer 內部真正做事的那個零件;Token,理解文字如何被切成模型看得懂的單位;還有混合專家模型,那是近年在 Transformer 上最主流的改法。這三個搞懂,大部分模型規格表都讀得動了。


延伸閱讀


參考來源

  1. The Annotated Transformer|harvardnlp — 論文原文逐段對照程式碼,本文的 6 層、d_model 512、8 個注意力頭、d_ff 2048、dropout 0.1、sin/cos 位置編碼、「第一個完全依賴自注意力的轉導模型」,以及 8 顆 P100、每步 0.4 秒、10 萬步約 12 小時、28.4 BLEU 都出自這裡。
  2. Tensor2Tensor 官方 README|tensorflow — 由 Google Brain 團隊開發、現已停止維護;翻譯任務建議使用 --model=transformer,8 張 GPU 跑 30 萬步約可達 28 BLEU。
  3. Transformer-based Encoder-Decoder Models|Hugging Face Blog — RNN 的梯度消失與無法平行化兩大限制、編碼器雙向自注意力與解碼器單向自注意力加交叉注意力的分工,以及 T5、BART、Pegasus 等代表模型。
  4. BERT 官方 README|google-research — BERT 全名、2018 年 10 月發表、遮蔽 15% 字詞的預訓練方式、Base 12 層 1.1 億參數與 Large 24 層 3.4 億參數、SQuAD v1.1 的 91.8 F1。
  5. Whisper 官方 README|openai — Whisper 是 Transformer 序列對序列模型,large 版 15.5 億參數,支援多語言辨識、語音翻譯與語言判定。
  6. Vision Transformer 官方 README|google-research — 〈An Image is Worth 16x16 Words〉論文、把圖片切成固定大小方塊後餵進標準 Transformer 編碼器的做法。
  7. transformers 官方 README|huggingface — Hugging Face Hub 上超過一百萬個模型檢查點,涵蓋文字、影像、音訊、影片與多模態。

整理一下重點:Transformer 真的就是「把整句話攤開來一次讀完」這一招,它換來的不是更聰明,是能平行運算,後面那些愈養愈大的模型全是這招的副產品。

希望這一篇有讓你對 Transformer 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。