一句話定義

多模態(Multimodal)是指同一個 AI 模型能同時處理文字、圖片、聲音、影片這些不同形式的資料,而不是只讀得懂其中一種。

30 秒看重點

  • 是什麼:多模態就是讓一個模型同時吃得下文字、圖片、聲音、影片,並且能把它們放在一起理解。
  • 為什麼重要:真實世界的資訊本來就不是純文字,只讀文字的 AI 等於閉著眼睛在工作。
  • 跟誰相關:想用手機拍照問 AI 的一般使用者、做客服與電商圖片搜尋的團隊、以及要接影像模型的工程師。
  • 最常見的誤解:很多人以為「能上傳圖片」就是多模態,其實不少工具只是外掛一個 OCR 再把文字丟給模型。
  • 記住這件事就夠了:多模態的重點不在於它能收幾種檔案,而在於這些東西有沒有被放進同一個腦袋裡一起想。

多模態到底是什麼?

多模態是一種 AI 系統的設計方式,讓同一個模型能接收並理解一種以上的資料形式,常見的就是文字、圖片、音訊、影片這四種。每一種形式在術語上叫做一個「模態」(modality),能跨模態一起推理的,才叫多模態。

拿 Hugging Face 官方部落格對視覺語言模型的說明來看,這類模型的骨架通常是三層堆起來的:一個影像編碼器負責看圖,一個嵌入投影層負責把圖片的表示法對齊文字的表示法(多半就是一層密集神經網路),最後接一個文字解碼器把答案寫出來。也就是說,圖片並不是「被翻譯成一段文字」再交出去,而是被轉成模型內部聽得懂的數字,跟文字站在同一個空間裡。

老實講,這個詞現在被行銷講得有點浮濫,看到「多模態」四個字先問一句:它是真的一起想,還是分開想完再拼起來?

生活比喻:你可以想像成看棒球轉播。畫面上投手投了一顆變化球、主播在喊「這球跑掉了」、記分板寫著兩好三壞,這三種資訊你是同時吸收的,腦袋自動合成一個「保送快出現了」的判斷。單模態 AI 是只給你聽聲音的收音機,多模態 AI 才是坐在電視機前面的你。

為什麼會有多模態?

多模態的出現是為了解決一件很現實的事:人類的資訊本來就長得亂七八糟,只認得純文字的模型接不住。

問題一:多數內容根本不是文字。 一張報帳收據、一段客服錄音、一支操作示範影片,硬要轉成文字都會掉東西。收據的版面位置沒了、錄音的語氣沒了、影片的動作順序也沒了。

問題二:拼接管線會層層失真。 早期做法是先用語音辨識轉文字、用 OCR 抓字,再把這串文字丟給語言模型。這就像你在電話裡請朋友描述一張照片,再請另一個人照著描述畫出來 — 中間每轉一手,細節就掉一層,而且轉述的人根本不知道後面那個人在意什麼。

那多模態怎麼解?答案是把「看」跟「想」放進同一套訓練裡。從 CLIP 開始,研究者用大量的(圖片、文字)配對去做對比學習,逼模型把一張圖跟它的文字說明放到同一個向量空間的相近位置。OpenAI 在 CLIP 的官方倉庫裡提到,這套做法讓模型在 ImageNet 上零樣本就追平原始 ResNet50 的表現,而且完全沒用到那 128 萬筆標註樣本。看圖這件事,第一次不用靠人工一張張貼標籤了。

多模態是怎麼運作的?

簡單來講就三步:各種資料各自找專屬的編碼器變成數字,再用一層投影把它們對齊到同一個空間,最後交給同一個解碼器一起推理。

  1. 各自編碼:圖片交給影像編碼器,聲音交給音訊編碼器。以 LLaVA 為例,它用的是凍結的 CLIP ViT-L/14 336px 當眼睛,這顆編碼器在訓練時完全不動。
  2. 投影對齊:中間那層是關鍵。LLaVA 官方倉庫寫得很清楚,它用一個兩層 MLP 的視覺語言連接器,把影像特徵接到語言模型上。第一階段的特徵對齊用了 558K 筆來自 LAION-CC-SBU 的圖說配對,第二階段的指令微調再用約 665K 筆資料,其中 150K 是 GPT 生成的多模態指令、515K 是視覺問答。
  3. 一起生成:對齊完,圖片對模型來說就跟文字一樣是一串可以推理的東西,答案由文字解碼器寫出來。

名詞小教室:這裡的「同一個空間」是 embedding(向量嵌入)的概念,就是把每個東西變成一組座標。CLIP 官方文件提到,它算出來的分數其實是圖片特徵與文字特徵的餘弦相似度乘以 100 — 講白了就是量兩個座標離多近。這套邏輯跟 向量資料庫(Vector Database) 那篇講的是同一件事,只是那邊用來找資料,這邊用來對齊感官。

原生多模態跟外掛拼接差在哪?

原生多模態是模型本身就看得到原始的圖片與聲音,外掛拼接是先把它們轉成文字再餵給模型,兩者拿到的東西根本不一樣。

比較項目原生多模態外掛拼接(單模態 + 工具)
模型看到什麼圖片、音訊本身轉成的向量已經被轉述過的一段文字
會掉什麼資訊掉得少,版面、語氣、空間關係留得住語氣、色調、版面位置幾乎全丟
系統複雜度一個模型搞定要串 OCR、語音辨識、模型三套
出錯時好不好查難拆,錯在哪層看不太出來好拆,可以逐段檢查中間結果
我會在什麼情況選它要理解畫面、影片、語氣的任務只是要抓文字內容,例如發票數字

從這張表可以看出來,外掛拼接沒有比較低級,它在「只需要文字」的場合反而更好維護、更好除錯。但只要任務碰到畫面裡的位置關係或說話者的情緒,那條轉述的電話線就會開始掉東西。

你會在哪些 AI 工具看到多模態?

多模態現在已經是主流工具的基本盤,你每天在用的那幾個大概都算。

「那我平常用的那個 AI,到底是原生還是外掛拼的?」老實講,各家沒有義務把架構攤開讓你看,閉源產品尤其查不到。這種時候別去猜參數,直接測它有沒有眼睛比較快,測法放在下面兩節。

  • Gemini:Google 官方的 Gemini Cookbook 列出的能力涵蓋文字、圖片、影片、音訊,包含語音與視訊串流的 Live API、3D 空間理解,輸出端還有 Imagen 這類圖片生成與 Veo 影片生成。
  • Qwen2.5-VL:阿里在 2025 年 1 月釋出,有 3B、7B、32B 幾種尺寸,強項是長影片理解、影片 OCR、以及帶版面座標的文件解析,甚至能操作手機與電腦的圖形介面。
  • Whisper:OpenAI 的開源語音模型,從 tiny(3,900 萬參數)到 large(15.5 億參數)共六種尺寸,另有 8.09 億參數的 turbo 版,能做多語辨識、翻譯成英文與語言判別,MIT 授權。

如果你是工程師,最常碰到的是 Hugging Face 上那批視覺語言模型。同一篇官方部落格列出的規格差異滿大:LLaVA 1.6 的 34B 版吃 672×672 解析度,moondream2 只有大約 2B 卻也支援 378×378,Qwen-VL 4B 是 448×448。挑模型時解析度往往比參數量更影響它讀不讀得出圖上的小字。

學多模態最常見的 3 個誤解

  1. 誤解一:能上傳圖片就是多模態 — 真相是要看它怎麼處理那張圖。若系統只是跑 OCR 抓出文字再交給語言模型,那模型從頭到尾沒看過圖,你問它「這張照片的氣氛如何」它就會開始編。
  2. 誤解二:多模態代表模型比較聰明 — 真相是多模態擴大的是輸入輸出範圍,不等於推理能力升級。MMMU 這種收了 11.5K 題大學程度多模態題目的評測會存在,正是因為「看得到」跟「看得懂」中間差很遠。
  3. 誤解三:多模態只有大廠玩得起 — 真相是門檻已經降很多。LLaVA 官方寫出來的數字是 8 張 A100 80GB,13B 版的視覺指令微調大約 20 小時、7B 版大約 10 小時。不是人人有 A100 沒錯,可是這離「只有前三大公司能碰」還很遠(而且開放權重模型一直在變小)。

想多了解多模態,從哪開始?

沒有技術背景的話,最快的方法是拿手機拍一張複雜的東西去問 AI,例如一張手寫收據或一份看不懂的合約截圖,然後追問它畫面右下角寫什麼。答得出位置關係的,通常是真的看得見。

有技術背景的話,建議直接讀 CLIP 的官方倉庫理解對比學習怎麼把圖文擠進同一個空間,接著看 LLaVA 的兩階段訓練,這兩份看完,市面上多數視覺語言模型的架構圖你都看得懂了。畢竟架構看懂一次可以用很久,記哪家又發表了什麼,下個月就過期。


常見問題 FAQ

多模態跟 AI 有什麼關係?

多模態是描述 AI 模型能力範圍的一個屬性,指的是它能不能同時處理一種以上的資料形式。現在主流的大型語言模型幾乎都往多模態走,因為使用者的問題本來就常常附帶截圖、照片或語音。可以把它理解成 AI 從「只會讀」進化到「看得到也聽得見」。

為什麼多模態突然這麼紅?

因為技術與需求剛好對上了。技術面從 2021 年的 CLIP 打開圖文對齊的做法,到 2023 年 LLaVA 提出視覺指令微調,把影像編碼器接上語言模型變成一件可複製的事。需求面則是各家旗艦模型都把多模態當成標配在賣,Google 的 Gemini Cookbook 就直接把影像、影片、音訊的輸入輸出全列進官方範例。

我不是工程師也需要懂多模態嗎?

不需要懂技術細節,但知道差別會讓你少踩雷。理解有些工具只是外掛 OCR 之後,你就會明白為什麼同一張圖片有的 AI 講得出配色與構圖,有的只會唸出上面的字。這件事直接影響你要把哪種任務交給哪個工具。

多模態的中文翻譯有沒有統一?

台灣繁體中文圈相當一致,幾乎都寫多模態,英文則直接講 multimodal 或 multi-modal。中國簡體中文用的是多模态,寫法一樣、只差在字體,也常看到多模态大模型這種合稱。本站統一採用多模態,英文標記 Multimodal AI。

學會多模態之後,下一個該學什麼?

建議先補 AI 的 Token,因為圖片與音訊進到模型之後同樣會換算成 token 計費,不懂這個很容易被帳單嚇到。接著看 Embedding 這個概念,那是所有模態能對齊的共同語言。行有餘力再研究 Transformer 架構,它是這些模型底層共用的骨架。


延伸閱讀


參考來源

  1. Hugging Face 官方部落格《Vision Language Models Explained》 — 影像編碼器加投影層加文字解碼器的三層架構、LLaVA 與 Fuyu-8B 的訓練差異、各模型解析度規格、MMMU 與 MMBench 題數。
  2. OpenAI CLIP 官方倉庫 — 以(圖片、文字)配對做對比學習、零樣本追平 ResNet50 而未使用 128 萬筆 ImageNet 標註、分數是餘弦相似度乘以 100、論文 arXiv 2103.00020。
  3. LLaVA 官方倉庫 — 兩層 MLP 視覺語言連接器接凍結的 CLIP ViT-L/14 336px、558K 圖說配對與約 665K 指令資料、8 張 A100 80GB 上 13B 約 20 小時,論文《Visual Instruction Tuning》NeurIPS 2023、arXiv 2304.08485。
  4. Google Gemini Cookbook 官方倉庫 — Gemini 在文字、圖片、影片、音訊的輸入輸出能力、Live API 串流、3D 空間理解、Imagen 與 Veo 的生成範例。
  5. Qwen2.5-VL 官方倉庫 — 2025 年 1 月釋出、3B 與 7B 與 32B 尺寸、長影片理解與影片 OCR、帶座標的文件解析、圖形介面操作能力。
  6. OpenAI Whisper 官方倉庫 — 六種模型尺寸從 3,900 萬到 15.5 億參數、8.09 億參數的 turbo 版、多語辨識與翻譯與語言判別、MIT 授權、論文 arXiv 2212.04356。

整理一下重點:多模態真的不是「能上傳幾種檔案」的規格比拼,它問的是那些畫面跟聲音有沒有進到同一個腦袋裡一起想。

希望這一篇有讓你對多模態有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。