一句話定義
MoE(Mixture of Experts,混合專家模型)是把模型內部拆成很多組小網路,每次運算只叫醒其中幾組的架構,所以參數可以很多,實際算的卻很少。
30 秒看重點
- 是什麼:MoE 讓模型把「總共會多少」跟「這次要動用多少」拆成兩個數字,回答時只啟用一小部分參數。
- 為什麼重要:DeepSeek、Qwen、gpt-oss 這些開源大模型都用它,模型長大但運算成本沒跟著等比放大。
- 跟誰相關:關心 AI 便不便宜的一般使用者、想在自己電腦跑模型的人,還有要編顯示卡預算的工程團隊。
- 最常見的誤解:很多人以為 MoE 的「專家」是醫療專家、法律專家那種分科,其實完全不是。
- 記住這件事就夠了:MoE 省的是計算,不是記憶體,模型該多大還是多大。
MoE 到底是什麼?
MoE 是一種把模型裡的前饋層換成「一堆小網路 + 一個分派員」的架構,每個 token 進來,分派員只挑幾個小網路出來算,其他的整批放著不動。這些小網路叫做專家(experts),那個分派員叫做路由(router)。
Hugging Face 官方那篇 MoE 說明講得很清楚,MoE 就兩個零件:一個是稀疏 MoE 層,裡面放著若干個專家,每個專家實際上就是一個前饋神經網路;另一個是閘門網路(gate network)或稱路由,負責決定哪個 token 要送去哪個專家。就這樣,沒有更玄的東西。
所以一顆模型會有兩個參數數字。DeepSeek-V3 官方 README 寫的是 6,710 億總參數、每個 token 只啟用 370 億,這兩個數字差了 18 倍,但它們都是真的。
生活比喻:想像一條有 256 個攤位的夜市。你今天晚上進去,只走到其中 8 攤買東西,剩下 248 攤你連看都沒看。你這一餐的花費,是 8 攤的錢,不是 256 攤的錢。可是這條夜市要開得成,248 個攤位還是得先把店開起來、燈點著、東西備好,這筆錢一毛都省不掉。MoE 就是這樣:吃的時候很省,開店的成本一點都不省。
為什麼會有 MoE?
因為傳統的稠密模型(dense model)每回答一個字,都要把全部參數從頭到尾算過一次,想讓模型更聰明就只能一直放大,算力帳單也跟著一起放大。
問題一是成本跟參數綁死。 稠密模型的參數量跟每次運算量幾乎是同一個數字,你想從 70 億參數長到 7,000 億,訓練跟每一次回答的成本就跟著長 100 倍。錢燒得比模型長得快。
問題二是很多參數其實用不到。 你問「今天天氣如何」,模型裡那些學過分子生物學的權重也得陪跑一遍,純粹浪費。
解法其實很直覺:讓模型自己決定這次要動用哪一塊就好,這件事叫條件式計算。這個想法不新,1991 年就有一篇叫〈Adaptive Mixture of Local Experts〉的論文打下基礎;真正做進大模型是 2017 年 Shazeer 等人那篇《Outrageously Large Neural Networks》,把 MoE 層塞進 1,370 億參數的 LSTM 裡,Hugging Face 也直說那個階段踩了不少雷,通訊成本高、訓練不穩定。到了 2022 年的 Switch Transformer 改成一次只選一個專家,拿到比 T5-XXL 快 4 倍的預訓練速度,這條路才算走通。
MoE 是怎麼運作的?
一個 token 進到 MoE 層,會經過打分、挑人、合併三個動作,全程不到一瞬間。
- 路由打分:路由看一眼這個 token,替每個專家打一個分數,代表「你適不適合處理它」。
- 挑前 k 名:分數最高的前 k 個專家被叫醒,其他的完全不參與。Switch Transformer 是 top-1(只挑 1 個),Mixtral 是 top-2,DeepSeek-V3 則是從 256 個專家裡挑 8 個。
- 加權合併:被挑中的專家各自算出結果,再照路由給的分數加權混起來,變成這一層的輸出。
名詞小教室:負載平衡(load balancing) 是 MoE 最難搞的地方。路由是學出來的,一旦某個專家稍微強一點就會被挑得更頻繁、練得更好、然後被挑得更更頻繁,最後變成一個專家累死、其他七個在納涼。Hugging Face 的說明寫得直白:要靠額外加一個輔助損失(auxiliary loss)逼路由把 token 分散出去。DeepSeek-V3 則宣稱走的是不用輔助損失的負載平衡策略。
MoE 跟稠密模型差在哪?
一句話:稠密模型是全部員工一起開會,MoE 是只找相關的幾個人進會議室,公司總人數沒變,開會成本差很多。
| 比較項目 | MoE(混合專家模型) | Dense(稠密模型) |
|---|---|---|
| 每次運算動用的參數 | 只有一小部分,例如 671B 中的 37B | 全部,一個都跑不掉 |
| 相同算力下能塞的知識 | 多很多,參數可以往上疊 | 受限於算力預算 |
| 顯示卡記憶體需求 | 跟總參數走,一點都省不了 | 跟總參數走 |
| 微調難度 | 較高,容易過擬合、還會弄壞路由 | 相對單純 |
| 推論速度 | 同樣總參數下明顯較快 | 較慢 |
從這張表可以看出來,MoE 是拿記憶體去換算力的一筆交易。如果你的瓶頸是「每個月的 API 帳單」,MoE 是好消息;如果你的瓶頸是「我只有一張顯示卡」,那 MoE 的總參數還是會照樣壓死你 QQ。老實講,這半邊最常被行銷稿含糊帶過。
你會在哪些 AI 模型看到 MoE?
下面這幾顆你大概聽過的開源模型都是 MoE,而且官方文件都直接把兩個參數數字並列給你看。
- DeepSeek-V3:官方 README 寫明 6,710 億總參數、370 億啟用,用了 MLA 與 DeepSeekMoE 兩套架構,在 14.8 兆個 token 上預訓練,全部訓練只花 278.8 萬個 H800 GPU 小時(技術報告以每小時 2 美元估算約 557.6 萬美元,這數字當時在業界吵了很久)。
- OpenAI gpt-oss:120b 版是 1,170 億參數、啟用 51 億,官方說一張 80GB 的 GPU 就跑得動;20b 版 210 億參數、啟用 36 億,寫明可以在 16GB 記憶體內運作,兩顆都是 Apache 2.0。
- Qwen3:阿里巴巴的 Qwen3-235B-A22B 跟 Qwen3-30B-A3B,型號名稱直接把總參數跟啟用參數寫進去,A22B 就是啟用 220 億的意思。
- Mixtral 8x7B:Mistral 在 2023 年 12 月 11 日發布的那顆,8 個專家、每個 token 路由挑 2 個,是把 MoE 帶進大眾視野的開源代表作。
順帶一提,你在日報看到的那些「幾兆參數」新聞,幾乎都是 MoE。像阿里巴巴 8 月開放的 Qwen3.8-Max是 2.4 兆總參數但每次只啟用 950 億,DeepSeek 7 月底的 V4-Flash-0731則是 2,840 億總參數、130 億啟用。下次看到這種標題,你就知道要看的是後面那個數字。
學 MoE 最常見的 3 個誤解
- 誤解一:「專家」是各領域的專家 — 真相是完全不是。這些專家是訓練過程長出來的前饋子網路,不對應人類的學科分類。Hugging Face 引用 ST-MoE 論文的觀察是:編碼器的專家會分工到標點符號這種淺層概念,解碼器的專家分工更不明顯,而在多語系模型裡,沒有任何一個專家專門負責某一種語言。「那我問醫療問題,會被送到醫療專家嗎?」不會,路由是逐個 token 在分派的,不是照題目分科。
- 誤解二:MoE 比較省記憶體 — 真相是省的是計算,不是記憶體。Hugging Face 講得很明白,所有參數都得載入記憶體,所以記憶體需求很高;Mixtral 8x7B 就是要準備得下一顆 47B 稠密模型的顯示卡記憶體,但推論起來像在跑 12B 模型。
廣告只會講後半句 - 誤解三:總參數越大就越強 — 真相是 MoE 跟同總參數的稠密模型不能直接畫上等號。MoE 的賣點是「在同樣的計算預算下表現更好」,不是「6,710 億參數等於 6,710 億參數的稠密模型」。看規格的時候,總參數看的是硬體門檻,啟用參數看的才是每次運算的份量。
想多了解 MoE,從哪開始?
沒有技術背景的話,下次看到模型規格,養成一個習慣就好:找有沒有兩個參數數字。看到「2,840 億總參數、130 億啟用」你就知道這是 MoE,也知道它的成本邏輯跟一顆 130 億的小模型比較接近。
有技術背景的話,直接讀 Hugging Face 的 MoE 說明,把路由、top-k、輔助損失三件事搞懂,剩下都是變形。想看實際規格就翻 DeepSeek-V3 的 README 跟 gpt-oss 的專案說明,兩邊都把架構寫得滿完整的。
常見問題 FAQ
MoE 跟 AI 有什麼關係?
MoE 是目前大型語言模型最主流的架構設計之一。它把模型內部的前饋層換成多個專家子網路,並由一個路由決定每個 token 要交給哪幾個專家處理,讓模型在參數規模大幅成長的同時,每次運算的成本維持在較低水準。DeepSeek、Qwen、gpt-oss 等開源模型都採用這個設計。
為什麼 MoE 突然這麼紅?
因為它同時解決了訓練成本與推論成本兩件事。DeepSeek-V3 用 278.8 萬個 H800 GPU 小時就完成 6,710 億參數模型的訓練,OpenAI 的 gpt-oss-120b 則讓 1,170 億參數的模型能在單張 80GB GPU 上運作。這些數字讓 MoE 從論文題目變成產業標準配備。
我不是工程師也需要懂 MoE 嗎?
如果你會看 AI 新聞,懂 MoE 可以幫你看懂規格數字。當新聞說某個模型有幾兆參數時,真正決定它跑起來多快、多貴的是啟用參數,而不是總參數。知道這件事,你比較不會被廠商的參數數字誤導。
MoE 的中文翻譯有沒有統一?
沒有完全統一。繁體中文圈常見「混合專家模型」與「專家混合模型」兩種譯法,指的是同一件事。本站一律採用「混合專家模型」,因為它比較貼近 Mixture of Experts 的字面順序,也是台灣技術社群較常出現的寫法。英文縮寫 MoE 則各家通用。
學會 MoE 之後,下一個該學什麼?
建議往三個方向延伸:AI 推論,理解為什麼啟用參數會直接影響回答速度與費用;量化,也就是怎麼把模型權重壓小以塞進有限的顯示卡記憶體;還有注意力機制,那是 Transformer 裡另外一半的核心零件。這三個加上 MoE,就能解釋大部分模型規格表上的數字。
延伸閱讀
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — MoE 是 LLM 的內部架構選擇,先懂 LLM 再看這篇會更順。
- AI 推論(Inference)是什麼? — 啟用參數少為什麼就比較快,答案在推論這一段。
- AI 的 Token 是什麼? — MoE 的路由是逐個 token 在分派的,先搞懂 token 才看得懂路由。
- Qwen3.8-Max 開權重,3 個訊號一次看 — 2.4 兆總參數、950 億啟用的實例,規格與定價都在這篇。
- 3 則新聞看懂 AI Agent 戰場換了打法 — DeepSeek-V4-Flash 2,840 億總參數、130 億啟用,架構沒動分數卻跳。
參考來源
- Mixture of Experts Explained|Hugging Face Blog — MoE 的兩大零件、專家就是前饋網路、1991 與 2017 兩篇論文的脈絡、Switch Transformer 快 4 倍、負載平衡與輔助損失、記憶體與微調的缺點,以及 Mixtral 8x7B 需要 47B 稠密模型記憶體、推論像 12B 的說法。
- DeepSeek-V3 官方 README|deepseek-ai — 6,710 億總參數/370 億啟用、MLA 與 DeepSeekMoE、無輔助損失負載平衡、14.8 兆訓練 token、278.8 萬 H800 GPU 小時。
- gpt-oss 官方 README|openai — 120b 為 1,170 億參數/51 億啟用、單張 80GB GPU 可跑;20b 為 210 億/36 億,16GB 記憶體內運作;兩者皆 Apache 2.0。
- Qwen3 官方 README|QwenLM — Qwen3-235B-A22B 與 Qwen3-30B-A3B 的總參數與啟用參數命名規則、Apache 2.0 授權。
- Mixtral of experts|Mistral AI 官方公告 — Mixtral 8x7B 於 2023 年 12 月 11 日發布,8 個專家、每個 token 由路由選出 2 個。
- DeepSeek-V3 Technical Report|arXiv 2412.19437 — 全部訓練 278.8 萬 GPU 小時、以每 GPU 小時 2 美元估算約 557.6 萬美元的成本推算。
整理一下重點:MoE 真的就是「參數養一大票、每次只叫幾個上工」,省下來的是算力不是記憶體,這一點分清楚,模型規格表就看得懂一半了。
希望這一篇有讓你對混合專家模型有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。