一句話定義

NPU(神經處理單元)是做在手機、筆電處理器裡的 AI 專用運算區塊,專門處理神經網路需要的大量矩陣運算,用比 CPU、GPU 少很多的電,在裝置上直接跑 AI。

30 秒看重點

  • 是什麼:NPU 是 Neural Processing Unit 的縮寫,是晶片裡只負責 AI 運算的專職區塊。
  • 為什麼重要:手機的人臉解鎖、視訊會議的背景模糊、即時字幕這些 AI 功能,靠它才能不燒電、不必上網就跑起來。
  • 跟誰相關:正在挑 AI 筆電或新手機的消費者、想把模型塞進裝置的開發者,以及在意資料不要上雲端的人。
  • 最常見的誤解:以為 TOPS 數字越大就越快,其實要看精度、要看軟體有沒有真的用到它。
  • 記住這件事就夠了:NPU 不是拿來取代 GPU 的,它是專門負責「在你自己裝置上、省電地跑 AI」那一塊。

NPU 到底是什麼?

NPU 是 Neural Processing Unit 的縮寫,中文叫神經處理單元,是整合在處理器裡、專門負責 AI 推論運算的硬體區塊。它通常跟 CPU、GPU 一起被做在同一顆晶片上,不會像顯示卡那樣另外插一張。

你可能常在筆電規格表或手機發表會聽到這個詞,卻不太確定它到底在忙什麼。

簡單來講,AI 模型在運作時,大部分時間都在做同一種事:一大堆數字相乘再相加,也就是矩陣運算。Intel 在官方 GitHub 的說明裡講得很直白,它的 NPU 裡有一組叫 Neural Compute Engines 的硬體加速區塊,專門處理「矩陣乘法與卷積」這類 AI 運算,旁邊再配上負責一般向量計算的 SHAVE 引擎,以及搬資料用的 DMA 引擎。

這邊真的關鍵是「搬資料」。Intel 的文件提到,它的編譯器會盡量讓運算留在晶片內的 SRAM(一塊很快的小暫存區)裡完成,減少跟主記憶體 DRAM 之間來回搬運,靠這樣換到更好的效能功耗比。

說白了,NPU 省電靠的除了算得快,還有少跑腿。

生活比喻:你可以想像成一間手搖飲店。CPU 是店長,點單、收錢、叫貨、處理客訴什麼都會;GPU 是一整排工讀生,可以同時搖二十杯;NPU 則是那台全自動封膜機,它只會封膜,但一杯一秒、又幾乎不耗人力。店裡如果每天要封上千杯,你絕對不會叫店長親自去封(店長會崩潰)。

為什麼會有 NPU?

NPU 的出現,是為了讓手機和筆電在「不插電、不連網」的情況下,也能隨時跑 AI 功能。

沒有它會怎樣?主要卡在兩個地方。

問題 1:CPU 跑 AI 太慢又太燙。 AI 要的是同時算成千上萬個乘法,叫 CPU 來做就像叫店長一個人封一千杯飲料,做得到,但很慢。

問題 2:GPU 跑 AI 很快,但太耗電。 GPU 擅長平行運算,可是它的耗電量對手機或輕薄筆電太奢侈。開個背景模糊電量就直直掉,大家應該會直接把功能關掉吧。

NPU 的解法很單純:只做一件事,然後把那件事做到很省電。2017 年 9 月 2 日,華為在德國 IFA 展發表 Kirin 970,自稱是「全球第一顆內建專用 NPU 的手機晶片」;十天後蘋果發表 A11 Bionic,首度放進 Neural Engine,每秒可做 6,000 億次運算,拿來跑 Face ID 和 Animoji。

從那之後,手機晶片幾乎都會配一顆 NPU,這幾年才輪到筆電。

NPU 是怎麼運作的?

NPU 的運作方式,是把 AI 模型拆成大量矩陣運算,交給一排專用電路同時處理,並盡量讓資料留在晶片內,少跟主記憶體來回搬。

拆成三個步驟來看:

  1. 模型先被編譯成 NPU 看得懂的格式:開發者用 OpenVINO、ONNX Runtime、Qualcomm AI Engine Direct 這類工具,把模型轉成目標晶片能吃的版本。這一步常常會順便做量化,把數字精度降到 8 位元整數。
  2. 運算分給專用硬體同時算:矩陣乘法交給 NPU 的加速區塊,一大批乘加運算同一時間完成,像封膜機一次壓一排杯子。
  3. 結果交回給系統:算完的答案回到 CPU 或應用程式手上,例如「這張臉是機主本人」「這段聲音是背景雜音,濾掉」。

這也是為什麼 NPU 對精度很挑。根據高通 AI Hub 在 GitHub 上的說明,它的 NPU(包含 Hexagon 架構)支援 FP16、INT16、INT8 三種精度,而且「部分較舊的晶片不支援在 NPU 上跑 FP16」。模型沒照它的口味處理過,就只能退回 CPU 或 GPU 跑。

名詞小教室:量化就是把模型裡的數字「四捨五入」到比較少的位數,換來更小、更快、更省電。NPU 偏愛整數運算,所以量化幾乎是上 NPU 的必經之路。想看完整原理可以讀這篇量化 AI 模型是什麼。

NPU 跟 GPU、CPU 差在哪?

NPU 是只做 AI 的省電專才,GPU 是什麼平行運算都能扛的大力士,CPU 是負責統籌全局的通才,三者在同一台裝置裡分工合作,不是互相取代。

比較項目NPUGPUCPU
擅長什麼AI 推論的矩陣運算大量平行運算(繪圖、AI 訓練與推論)循序邏輯、作業系統、統籌各種工作
耗電最低高中等
彈性低,只吃特定格式的模型中高最高
常見場景背景模糊、降噪、即時字幕、人臉解鎖遊戲、剪片、大型模型訓練開瀏覽器、跑 Office、管理整台電腦
我會在什麼情況選它需要長時間開著、又要顧電池的 AI 功能一次性的重量級運算,插著電跑任務雜、需要判斷流程的時候

從這張表可以看出來,NPU 的強項是「撐得久」,論蠻力還是 GPU 比較猛。

先講結論:如果是視訊會議開一小時的背景模糊,交給 NPU;如果是在本機跑一個比較大的語言模型、或剪 4K 影片,GPU 還是主力。AMD 的 Ryzen AI 官方範例裡,甚至直接有一個「NPU-GPU pipeline」的展示,把工作拆給兩邊一起做,這才是現在的主流打法。

你會在哪些 AI 工具看到 NPU?

你每天用的手機和新筆電,幾乎都已經默默在用 NPU 了,只是它不會跳出來跟你打招呼。

  • iPhone 與 Mac 的 Neural Engine:蘋果把自家的 NPU 叫 Neural Engine。蘋果在 GitHub 公開的 ml-ane-transformers 專案寫明,A14 以後的手機晶片與 M1 以後的 Mac 晶片都有它,經過最佳化的 Transformer 模型最多可以快 10 倍、尖峰記憶體用量少 14 倍。Xcode 27 的程式碼補全也是直接在 Neural Engine 上跑。
  • Copilot+ PC:微軟規定 NPU 本身要有 40 TOPS 以上的算力,才能掛上 Copilot+ PC 的名號,搭配至少 16GB 記憶體與 256GB SSD。視訊特效、即時字幕翻譯、小畫家 Cocreator、Recall 都靠 NPU 撐。
  • Google Pixel:Pixel 11 的 Tensor G6 由台積電 2 奈米製程生產,本站當時報導過,它的 TPU 算力增加 50%,裝置端 AI 任務最快 3.5 倍。
  • Android 旗艦手機:高通 AI Hub 列出的支援裝置包含 Samsung Galaxy S21 到 S25 系列、小米 12 到 17 等。

工程師碰到 NPU 的地方通常是這幾個:Intel 平台走 OpenVINO(舊的 Intel NPU Acceleration Library 已經宣布停止維護,官方建議改用 OpenVINO);AMD 平台走 Ryzen AI Software,可以透過 ONNX Runtime GenAI 或 Windows ML 在 NPU 上跑 LLM;高通平台則是 Qualcomm AI Engine Direct、LiteRT、ONNX 三選一。微軟的 Foundry Local 更省事,它會自己偵測裝置有什麼硬體,在 NPU、GPU、CPU 之間挑最適合的版本來跑。

學 NPU 最常見的 3 個誤解

NPU 最常被誤會的,是把規格表數字當成實際體驗,或以為有了它就能跑任何 AI。

  1. 誤解一:TOPS 越高就一定越快 — 真相是 TOPS 沒標精度就沒有意義。TOPS 是「每秒可做幾兆次運算」,各家幾乎都用 INT8 來量,因為位數越少數字越漂亮;同一顆晶片換成 FP16 可能只剩一半。有些廠商還會報「稀疏」算力,前提是模型裡有一堆可以跳過的零,實際用起來不一定吃得到。規格表上的數字,本來就是給你看的,不是給你用的
  2. 誤解二:買了 AI 筆電,就能在本機跑 ChatGPT — 真相是 NPU 擅長的是小模型、長時間的輕量任務。ChatGPT 等級的大模型還是在雲端跑,筆電能跑的通常是壓縮過的小模型,而且記憶體大小往往比 NPU 算力更先卡住你。
  3. 誤解三:有 NPU 的電腦就是 Copilot+ PC — 真相是門檻是 NPU「單獨」要達到 40 TOPS。Intel 第一代 Core Ultra(Meteor Lake)雖然有 NPU,整顆晶片號稱 34 TOPS,但 NPU 自己分到的不到三分之一,所以拿不到 Copilot+ 的資格。

「那我現在買筆電,到底要不要在意 NPU?」老實講,如果你常開視訊會議、在意續航、想用 Windows 的 AI 功能,選一台過 40 TOPS 門檻的就夠了;如果你主要是打遊戲或剪片,GPU 規格還是比較重要。

想多了解 NPU,從哪開始?

沒有技術背景的話,最快的方法是打開 Windows 11 的工作管理員,在「效能」分頁找找看有沒有 NPU,再開個視訊會議、打開背景模糊,看它的使用率會不會跳起來。如果 NPU 一直停在 0%,代表那個 AI 功能根本沒用到它,是退回 CPU 或 GPU 在跑。

買電腦前,也可以養成一個習慣:看到 TOPS 先問兩件事,「這是 NPU 自己的,還是整顆晶片加起來的?」「這是 INT8 還是別的精度?」

有技術背景的話,從手上的硬體出發:Mac 看蘋果的 ml-ane-transformers,Windows 先裝 Foundry Local 比較 NPU 和 GPU 的速度差,Android 去翻高通 AI Hub 的現成範例。搭配本站的AI 推論條目一起看,會更清楚 NPU 在整條流程裡站在哪個位置。


常見問題 FAQ

NPU 跟 AI 有什麼關係?

NPU 是專門為 AI 運算設計的硬體,負責在手機、筆電上直接執行 AI 模型的推論工作。人臉解鎖、視訊背景模糊、即時字幕這些 AI 功能,都是由 NPU 用低耗電的方式在裝置端完成,不需要把資料傳到雲端。

為什麼 NPU 突然這麼紅?

NPU 在 2017 年就已經進入手機,但真正被大家討論,是 2024 年微軟推出 Copilot+ PC,規定 NPU 要有 40 TOPS 以上才能掛名。之後 Intel、AMD、高通、蘋果都把 NPU 算力寫進新晶片的主打規格,AI PC 這個詞也跟著紅起來。

我不是工程師也需要懂 NPU 嗎?

如果你最近要買筆電或手機,懂一點 NPU 會很有幫助。它決定了裝置能不能用某些 AI 功能、開這些功能時電池會掉多快,也是挑 AI 筆電時最常看到的規格。只要知道 TOPS 要看 NPU 本身、40 TOPS 是 Copilot+ PC 的門檻,就足以避開大部分行銷話術。

NPU 的中文翻譯有沒有統一?

台灣多半直接講 NPU,中文常見寫法是「神經處理單元」,本站也統一使用這個譯名。各家品牌也有自己的叫法,例如蘋果叫 Neural Engine,Google 在 Tensor 晶片裡叫 TPU,高通的則是 Hexagon NPU,本質上都是同一類 AI 專用硬體。

學會 NPU 之後,下一個該學什麼?

建議接著看三個概念:AI 推論,了解 NPU 實際在執行的是哪一段工作;量化,了解模型為什麼要先壓縮才跑得進 NPU;以及大型語言模型,理解為什麼最大的模型目前還是只能在雲端跑。


延伸閱讀


參考來源

  1. Intel NPU Acceleration Library|Intel on GitHub — Intel NPU 架構,以及專案停止維護、改用 OpenVINO 的公告。
  2. Intel NPU 架構說明文件|Intel on GitHub — 矩陣運算硬體與減少 SRAM、DRAM 搬運的省電策略。
  3. Linux NPU Driver|Intel on GitHub — NPU 自 Core Ultra(Meteor Lake)起整合進 Intel CPU。
  4. ml-ane-transformers|Apple on GitHub — 支援晶片範圍與最多快 10 倍、記憶體少 14 倍的數字。
  5. Qualcomm AI Hub Models|Qualcomm on GitHub — NPU 支援精度、裝置清單與執行環境。
  6. Ryzen AI Software|AMD on GitHub — 在 Ryzen AI NPU 上跑 LLM 與 NPU-GPU pipeline 範例。
  7. Foundry Local|Microsoft on GitHub — 自動在 NPU、GPU、CPU 之間挑選模型版本。

關於本篇的查證限制:撰寫當下 Microsoft、Apple、Qualcomm 官方網站與 IBM、TechCrunch 等網域無法直接讀取。Copilot+ PC 的 40 TOPS、16GB 記憶體、256GB SSD 門檻與相關功能,Kirin 970 於 IFA 2017 發表、A11 Bionic 每秒 6,000 億次運算,Meteor Lake 的 34 TOPS 中 NPU 不到三分之一,以及 TOPS 多以 INT8 計算、稀疏算力會讓數字翻倍等內容,皆經兩個以上獨立搜尋結果比對才寫入,並未列入上方參考來源。


整理一下重點:NPU 真的就是晶片裡那台「只會做 AI、但做得超省電」的專職機器,看 TOPS 時記得問清楚是誰的、用什麼精度算的,就不太會被規格表帶著走。

希望這一篇有讓你對 NPU 有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。