一句話定義
多模態(Multimodal)是指同一個 AI 模型能同時處理文字、圖片、聲音、影片這些不同形式的資料,而不是只讀得懂其中一種。
30 秒看重點
- 是什麼:多模態就是讓一個模型同時吃得下文字、圖片、聲音、影片,並且能把它們放在一起理解。
- 為什麼重要:真實世界的資訊本來就不是純文字,只讀文字的 AI 等於閉著眼睛在工作。
- 跟誰相關:想用手機拍照問 AI 的一般使用者、做客服與電商圖片搜尋的團隊、以及要接影像模型的工程師。
- 最常見的誤解:很多人以為「能上傳圖片」就是多模態,其實不少工具只是外掛一個 OCR 再把文字丟給模型。
- 記住這件事就夠了:多模態的重點不在於它能收幾種檔案,而在於這些東西有沒有被放進同一個腦袋裡一起想。
多模態到底是什麼?
多模態是一種 AI 系統的設計方式,讓同一個模型能接收並理解一種以上的資料形式,常見的就是文字、圖片、音訊、影片這四種。每一種形式在術語上叫做一個「模態」(modality),能跨模態一起推理的,才叫多模態。
拿 Hugging Face 官方部落格對視覺語言模型的說明來看,這類模型的骨架通常是三層堆起來的:一個影像編碼器負責看圖,一個嵌入投影層負責把圖片的表示法對齊文字的表示法(多半就是一層密集神經網路),最後接一個文字解碼器把答案寫出來。也就是說,圖片並不是「被翻譯成一段文字」再交出去,而是被轉成模型內部聽得懂的數字,跟文字站在同一個空間裡。
老實講,這個詞現在被行銷講得有點浮濫,看到「多模態」四個字先問一句:它是真的一起想,還是分開想完再拼起來?
生活比喻:你可以想像成看棒球轉播。畫面上投手投了一顆變化球、主播在喊「這球跑掉了」、記分板寫著兩好三壞,這三種資訊你是同時吸收的,腦袋自動合成一個「保送快出現了」的判斷。單模態 AI 是只給你聽聲音的收音機,多模態 AI 才是坐在電視機前面的你。
為什麼會有多模態?
多模態的出現是為了解決一件很現實的事:人類的資訊本來就長得亂七八糟,只認得純文字的模型接不住。
問題一:多數內容根本不是文字。 一張報帳收據、一段客服錄音、一支操作示範影片,硬要轉成文字都會掉東西。收據的版面位置沒了、錄音的語氣沒了、影片的動作順序也沒了。
問題二:拼接管線會層層失真。 早期做法是先用語音辨識轉文字、用 OCR 抓字,再把這串文字丟給語言模型。這就像你在電話裡請朋友描述一張照片,再請另一個人照著描述畫出來 — 中間每轉一手,細節就掉一層,而且轉述的人根本不知道後面那個人在意什麼。
那多模態怎麼解?答案是把「看」跟「想」放進同一套訓練裡。從 CLIP 開始,研究者用大量的(圖片、文字)配對去做對比學習,逼模型把一張圖跟它的文字說明放到同一個向量空間的相近位置。OpenAI 在 CLIP 的官方倉庫裡提到,這套做法讓模型在 ImageNet 上零樣本就追平原始 ResNet50 的表現,而且完全沒用到那 128 萬筆標註樣本。看圖這件事,第一次不用靠人工一張張貼標籤了。
多模態是怎麼運作的?
簡單來講就三步:各種資料各自找專屬的編碼器變成數字,再用一層投影把它們對齊到同一個空間,最後交給同一個解碼器一起推理。
- 各自編碼:圖片交給影像編碼器,聲音交給音訊編碼器。以 LLaVA 為例,它用的是凍結的 CLIP ViT-L/14 336px 當眼睛,這顆編碼器在訓練時完全不動。
- 投影對齊:中間那層是關鍵。LLaVA 官方倉庫寫得很清楚,它用一個兩層 MLP 的視覺語言連接器,把影像特徵接到語言模型上。第一階段的特徵對齊用了 558K 筆來自 LAION-CC-SBU 的圖說配對,第二階段的指令微調再用約 665K 筆資料,其中 150K 是 GPT 生成的多模態指令、515K 是視覺問答。
- 一起生成:對齊完,圖片對模型來說就跟文字一樣是一串可以推理的東西,答案由文字解碼器寫出來。
名詞小教室:這裡的「同一個空間」是 embedding(向量嵌入)的概念,就是把每個東西變成一組座標。CLIP 官方文件提到,它算出來的分數其實是圖片特徵與文字特徵的餘弦相似度乘以 100 — 講白了就是量兩個座標離多近。這套邏輯跟 向量資料庫(Vector Database) 那篇講的是同一件事,只是那邊用來找資料,這邊用來對齊感官。
原生多模態跟外掛拼接差在哪?
原生多模態是模型本身就看得到原始的圖片與聲音,外掛拼接是先把它們轉成文字再餵給模型,兩者拿到的東西根本不一樣。
| 比較項目 | 原生多模態 | 外掛拼接(單模態 + 工具) |
|---|---|---|
| 模型看到什麼 | 圖片、音訊本身轉成的向量 | 已經被轉述過的一段文字 |
| 會掉什麼資訊 | 掉得少,版面、語氣、空間關係留得住 | 語氣、色調、版面位置幾乎全丟 |
| 系統複雜度 | 一個模型搞定 | 要串 OCR、語音辨識、模型三套 |
| 出錯時好不好查 | 難拆,錯在哪層看不太出來 | 好拆,可以逐段檢查中間結果 |
| 我會在什麼情況選它 | 要理解畫面、影片、語氣的任務 | 只是要抓文字內容,例如發票數字 |
從這張表可以看出來,外掛拼接沒有比較低級,它在「只需要文字」的場合反而更好維護、更好除錯。但只要任務碰到畫面裡的位置關係或說話者的情緒,那條轉述的電話線就會開始掉東西。
你會在哪些 AI 工具看到多模態?
多模態現在已經是主流工具的基本盤,你每天在用的那幾個大概都算。
「那我平常用的那個 AI,到底是原生還是外掛拼的?」老實講,各家沒有義務把架構攤開讓你看,閉源產品尤其查不到。這種時候別去猜參數,直接測它有沒有眼睛比較快,測法放在下面兩節。
- Gemini:Google 官方的 Gemini Cookbook 列出的能力涵蓋文字、圖片、影片、音訊,包含語音與視訊串流的 Live API、3D 空間理解,輸出端還有 Imagen 這類圖片生成與 Veo 影片生成。
- Qwen2.5-VL:阿里在 2025 年 1 月釋出,有 3B、7B、32B 幾種尺寸,強項是長影片理解、影片 OCR、以及帶版面座標的文件解析,甚至能操作手機與電腦的圖形介面。
- Whisper:OpenAI 的開源語音模型,從 tiny(3,900 萬參數)到 large(15.5 億參數)共六種尺寸,另有 8.09 億參數的 turbo 版,能做多語辨識、翻譯成英文與語言判別,MIT 授權。
如果你是工程師,最常碰到的是 Hugging Face 上那批視覺語言模型。同一篇官方部落格列出的規格差異滿大:LLaVA 1.6 的 34B 版吃 672×672 解析度,moondream2 只有大約 2B 卻也支援 378×378,Qwen-VL 4B 是 448×448。挑模型時解析度往往比參數量更影響它讀不讀得出圖上的小字。
學多模態最常見的 3 個誤解
- 誤解一:能上傳圖片就是多模態 — 真相是要看它怎麼處理那張圖。若系統只是跑 OCR 抓出文字再交給語言模型,那模型從頭到尾沒看過圖,你問它「這張照片的氣氛如何」它就會開始編。
- 誤解二:多模態代表模型比較聰明 — 真相是多模態擴大的是輸入輸出範圍,不等於推理能力升級。MMMU 這種收了 11.5K 題大學程度多模態題目的評測會存在,正是因為「看得到」跟「看得懂」中間差很遠。
- 誤解三:多模態只有大廠玩得起 — 真相是門檻已經降很多。LLaVA 官方寫出來的數字是 8 張 A100 80GB,13B 版的視覺指令微調大約 20 小時、7B 版大約 10 小時。不是人人有 A100 沒錯,可是這離「只有前三大公司能碰」還很遠(而且開放權重模型一直在變小)。
想多了解多模態,從哪開始?
沒有技術背景的話,最快的方法是拿手機拍一張複雜的東西去問 AI,例如一張手寫收據或一份看不懂的合約截圖,然後追問它畫面右下角寫什麼。答得出位置關係的,通常是真的看得見。
有技術背景的話,建議直接讀 CLIP 的官方倉庫理解對比學習怎麼把圖文擠進同一個空間,接著看 LLaVA 的兩階段訓練,這兩份看完,市面上多數視覺語言模型的架構圖你都看得懂了。畢竟架構看懂一次可以用很久,記哪家又發表了什麼,下個月就過期。
常見問題 FAQ
多模態跟 AI 有什麼關係?
多模態是描述 AI 模型能力範圍的一個屬性,指的是它能不能同時處理一種以上的資料形式。現在主流的大型語言模型幾乎都往多模態走,因為使用者的問題本來就常常附帶截圖、照片或語音。可以把它理解成 AI 從「只會讀」進化到「看得到也聽得見」。
為什麼多模態突然這麼紅?
因為技術與需求剛好對上了。技術面從 2021 年的 CLIP 打開圖文對齊的做法,到 2023 年 LLaVA 提出視覺指令微調,把影像編碼器接上語言模型變成一件可複製的事。需求面則是各家旗艦模型都把多模態當成標配在賣,Google 的 Gemini Cookbook 就直接把影像、影片、音訊的輸入輸出全列進官方範例。
我不是工程師也需要懂多模態嗎?
不需要懂技術細節,但知道差別會讓你少踩雷。理解有些工具只是外掛 OCR 之後,你就會明白為什麼同一張圖片有的 AI 講得出配色與構圖,有的只會唸出上面的字。這件事直接影響你要把哪種任務交給哪個工具。
多模態的中文翻譯有沒有統一?
台灣繁體中文圈相當一致,幾乎都寫多模態,英文則直接講 multimodal 或 multi-modal。中國簡體中文用的是多模态,寫法一樣、只差在字體,也常看到多模态大模型這種合稱。本站統一採用多模態,英文標記 Multimodal AI。
學會多模態之後,下一個該學什麼?
建議先補 AI 的 Token,因為圖片與音訊進到模型之後同樣會換算成 token 計費,不懂這個很容易被帳單嚇到。接著看 Embedding 這個概念,那是所有模態能對齊的共同語言。行有餘力再研究 Transformer 架構,它是這些模型底層共用的骨架。
延伸閱讀
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — 多模態多半是在語言模型上加感官,先懂它才好懂這篇。
- 向量資料庫(Vector Database)是什麼?RAG 背後找相似資料的關鍵零件 — 圖片與音訊要進同一個向量空間,靠的是同一套相似度邏輯。
- AI 的 Token 是什麼?一次搞懂 AI 計費單位、中文換算與上下文上限 — 上傳圖片與音訊為什麼會燒掉那麼多額度,答案在這篇。
- AI 五分鐘快報:Qwen 27B 開源、Anthropic 調高風險等級 — 那批 Apache 2.0 開放權重就是原生多模態,文字、圖片、影片都吃,原生脈絡 262,144 個 token。
參考來源
- Hugging Face 官方部落格《Vision Language Models Explained》 — 影像編碼器加投影層加文字解碼器的三層架構、LLaVA 與 Fuyu-8B 的訓練差異、各模型解析度規格、MMMU 與 MMBench 題數。
- OpenAI CLIP 官方倉庫 — 以(圖片、文字)配對做對比學習、零樣本追平 ResNet50 而未使用 128 萬筆 ImageNet 標註、分數是餘弦相似度乘以 100、論文 arXiv 2103.00020。
- LLaVA 官方倉庫 — 兩層 MLP 視覺語言連接器接凍結的 CLIP ViT-L/14 336px、558K 圖說配對與約 665K 指令資料、8 張 A100 80GB 上 13B 約 20 小時,論文《Visual Instruction Tuning》NeurIPS 2023、arXiv 2304.08485。
- Google Gemini Cookbook 官方倉庫 — Gemini 在文字、圖片、影片、音訊的輸入輸出能力、Live API 串流、3D 空間理解、Imagen 與 Veo 的生成範例。
- Qwen2.5-VL 官方倉庫 — 2025 年 1 月釋出、3B 與 7B 與 32B 尺寸、長影片理解與影片 OCR、帶座標的文件解析、圖形介面操作能力。
- OpenAI Whisper 官方倉庫 — 六種模型尺寸從 3,900 萬到 15.5 億參數、8.09 億參數的 turbo 版、多語辨識與翻譯與語言判別、MIT 授權、論文 arXiv 2212.04356。
整理一下重點:多模態真的不是「能上傳幾種檔案」的規格比拼,它問的是那些畫面跟聲音有沒有進到同一個腦袋裡一起想。
希望這一篇有讓你對多模態有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。