一句話定義
AI 幻覺(Hallucination)指的是 AI 生成出看起來很合理、語氣很肯定,事實上卻不存在或不正確的內容。
30 秒看重點
- 是什麼:AI 幻覺是 AI 把不存在的事講得跟真的一樣,不是它「當機」也不是它「說謊」。
- 為什麼重要:錯得越流暢越難發現,已經有律師、航空公司因此被法院判賠或處罰。
- 跟誰相關:拿 AI 查資料的一般使用者、把 AI 接進產品的工程師,還有正在評估導入 AI 的主管。
- 最常見的誤解:以為幻覺是模型還不夠強,其實它跟訓練與評分的規則綁在一起,換更大的模型也消不掉。
- 記住這件事就夠了:AI 講得越流暢越有自信,跟它講得對不對,完全是兩回事。
AI 幻覺到底是什麼?
AI 幻覺指的是 AI 產生出「聽起來合理、但事實上不存在或錯誤」的內容,例如編造一篇沒發表過的論文、掰一個沒發生過的判決、或是給你一個查無此人的名字。
學術上還會再切成兩種:一種是內在幻覺(intrinsic),生成的內容跟你給它的原始資料直接矛盾;另一種是外在幻覺(extrinsic),內容沒辦法從原始資料驗證,它自己補上去的。實務上你不用背這兩個詞,只要記得幻覺有兩種味道就好:一種是把你給的資料講反,一種是無中生有。
這個詞紅到什麼程度?劍橋詞典把 hallucinate 選為 2023 年的年度代表字,並且為它加上一條全新的定義:當人工智慧產生幻覺時,它會生成假的資訊。一個原本用來描述人類精神狀態的字,被 AI 整個接收走了。
生活比喻:你可以想像成路邊問路。有些人明明不知道,但就是講不出「我不知道」這四個字,於是手往前一指說「直走第二個紅綠燈右轉」。他不是想騙你,他只是覺得給個答案比較有面子。AI 幻覺就是這個狀態,而且它指路的口氣比誰都篤定。
為什麼會有 AI 幻覺?
AI 幻覺不是 bug,是大型語言模型運作方式加上評分制度共同養出來的結果。
原因一:它的工作是接話,不負責查證。 語言模型本質上在做的事情是預測下一個字最可能是什麼。「愛因斯坦出生於」後面接一個年份,統計上非常順,至於那個年份對不對,模型本身沒有一個獨立的「事實資料庫」可以去對答案。順跟對,是兩套標準。
原因二:整套評測制度都在獎勵猜測。 OpenAI 在 2025 年 9 月發表的論文〈Why Language Models Hallucinate〉直接把矛頭指向評分方式:模型被訓練成很會考試的考生,而主流的評測基準通常答對得分、答錯零分、說「我不知道」也是零分。既然如此,遇到不確定的題目當然是猜一個比較划算。作者群包含 Adam Tauman Kalai、Ofir Nachum、Santosh Vempala 與 Edwin Zhang,他們在論文裡還推導出一個滿殘忍的結論:生成答案這件事天生比判斷對錯更難,生成的錯誤率至少會是分類錯誤率的兩倍。
老實講,這篇論文最有價值的地方是它把責任從模型身上挪開了。他們主張真正該修的是評分機制,讓那些既有的、排行榜上說話最大聲的基準不再懲罰誠實的棄答,而不是再多加幾個幻覺測驗。
AI 幻覺是怎麼發生的?
拆到最小,幻覺就是「不知道 → 但不能空白 → 挑一個最順的答案」這三步。
- 遇到訓練資料裡沒有、或很稀疏的東西:例如某個冷門人物的生日、某家公司昨天發的公告。這種資訊在訓練資料裡出現次數極少,模型根本沒學到。
- 系統預設不允許空白:你問了,它就得回。除非有人特別設計過棄答機制,不然模型不會主動說「這題我沒把握」。
- 挑一個統計上最像答案的答案:於是你拿到一個格式完美、細節齊全、看起來就是那麼一回事的回覆。案號有、年份有、法官名字也有,只是查不到。
生活比喻二:這就像在寫一份不倒扣的選擇題。空白鐵定 0 分,隨便猜至少有機會中。你會怎麼做?AI 也是這樣想的(如果它會想的話)。
AI 幻覺跟「資料過期」差在哪?
最簡單的分法:資料過期是它沒學到,幻覺是它編出來。兩件事都會讓你拿到錯的答案,但要救的方法完全不一樣。
| 比較項目 | AI 幻覺 | 資料過期(知識截止) |
|---|---|---|
| 問題本質 | 模型憑統計慣性生成不存在的內容 | 訓練資料停在某個時間點之後就沒更新 |
| 你看到的樣子 | 細節齊全但查無此事 | 講的是幾個月前甚至去年的舊狀況 |
| 錯得明不明顯 | 很難察覺,因為它講得很完整 | 相對好抓,通常一查就發現是舊聞 |
| 常見解法 | 交叉查證、要求附出處、限縮回答範圍 | 給它即時資料,例如接搜尋或 RAG |
| 換更大的模型有救嗎 | 沒有,只會變少不會歸零 | 有,新模型的知識截止日比較新 |
從這張表可以看出來,這兩件事最好分開處理。如果你的痛點是「AI 不知道我們公司最新的規定」,那要補的是資料管道;如果痛點是「AI 引用了一篇不存在的論文」,那要補的是查證流程。把後者當成前者去解,通常會失望。
名詞小教室:上表提到的 RAG(Retrieval-Augmented Generation,檢索增強生成),簡單來講就是讓 AI 回答之前先去翻指定的資料,翻完再答,這樣它比較沒有空間亂編。要注意的是 RAG 會降低幻覺,不會消滅幻覺,因為它還是有可能把翻到的資料講歪。
AI 幻覺真的出過事嗎?
出過,而且已經燒到法院了。三個案子最常被拿出來當教材。
- 美國 Mata v. Avianca 案:兩名律師用 ChatGPT 找判例,結果書狀裡六個引用的判決全是虛構的。紐約南區聯邦地方法院在 2023 年 6 月 22 日作出裁定,對相關律師處以 5,000 美元罰款。整件事最傷的其實不是用了 AI,是被質疑之後還硬拗了一段時間。
- 加拿大 Moffatt v. Air Canada 案:加航官網的聊天機器人告訴一位剛喪親的乘客,可以先買全票、事後 90 天內再申請喪親折扣,但加航的實際規定必須事前申請。卑詩省民事解決法庭在 2024 年 2 月 14 日認定加航構成過失不實陳述,判賠 812.02 加幣。加航一度主張聊天機器人是獨立的法律主體、要自己負責,法庭沒有買單,理由是網站上的資訊不管來自靜態頁面還是機器人,公司都要負責。
- 台灣桃園地院的判決附註:據聯合新聞網、ETtoday 等媒體 2026 年 7 月 31 日報導,桃園地院法官孫健智在一起祖厝土地買賣糾紛的判決開頭寫下「不要問 AI,不要用 AI 寫上訴狀,更不要以為人家看不出是 AI 寫的」,並建議原告去找「活生生的、有血有肉有執照的律師」。報導指出原告為了這場官司繳了 9 萬多元裁判費、遞了幾百頁書狀。
順帶一提,前兩個案子的共同點是:出錯的都不是模型本身,是「沒有人在最後一關看一眼」這個流程缺口。
那產業怎麼量幻覺?
目前業界最常被引用的是 Vectara 的 Hallucination Leaderboard。它的做法是給模型一篇文章、要它寫摘要,再用自家的 HHEM 偵測模型去評分,分數低於 0.5 就判定為幻覺,最後算出「有多少比例的摘要出現幻覺」。新版排行榜用的資料集超過 7,700 篇文章,涵蓋法律、醫療、金融、教育與科技等領域。
不過這裡有個很容易誤讀的地方:這個榜量的是「摘要有沒有忠於給定的文件」,跟「模型對世界的知識準不準」是兩回事。看到某個模型幻覺率壓到 1% 就以為它問什麼都不會錯,那是誤會了。行銷素材最愛拿這種數字
我們日報這邊也追過幾次相關的數字。像 Grok 4.5 把程式碼代理成本砍到剩兩成多,代價是幻覺率從 25% 翻到 54%;Google 的 Gemini 3.5 Pro 則傳出因為幻覺問題頻繁、品質不達標而延後上線。便宜、快、準這三件事,目前還是很難同時要到。
學 AI 幻覺最常見的 3 個誤解
- 誤解一:幻覺是模型還不夠成熟,以後會被修好 — 真相是它跟「生成」這個行為綁在一起。OpenAI 那篇論文的立場很清楚,只要評分制度還在獎勵猜測,模型就沒有動機說「我不知道」。目前能做的是降低,不是歸零。
- 誤解二:AI 是故意騙人 — 真相是模型沒有「知道自己在說謊」的機制。它產生錯誤答案跟產生正確答案,走的是同一套流程,內部沒有一個開關標記「這句我在唬爛」。
- 誤解三:接了 RAG 或搜尋就不會有幻覺 — 真相是接外部資料能大幅減少憑空捏造,但模型仍可能把讀到的資料理解錯、摘要歪,或是把兩份文件的內容混在一起。Vectara 那個榜量的就是這種情況,而且分數從來沒有人是零。
想少踩 AI 幻覺的坑,可以怎麼做?
如果你沒有技術背景:養成三個習慣就能擋掉八成。第一,凡是人名、數字、法條、案號、論文標題,一律自己再搜一次。第二,直接跟 AI 要出處連結,然後真的點進去看(它給的連結也可能是編的)。第三,問「你有多確定?有沒有可能是錯的?」很多模型在被追問時會鬆口。
如果你是工程師:把幻覺當成系統性風險來設計。常見做法包括接 RAG 把回答限縮在指定文件內、在提示裡明確允許模型回答「資料不足」、對關鍵欄位做二次驗證,以及在介面上把來源攤開讓人可以自己查。畢竟你擋不住模型偶爾亂講,但你擋得住它亂講之後沒人發現。
常見問題 FAQ
AI 幻覺跟 AI 有什麼關係?
AI 幻覺是生成式 AI 的固有特性之一,特別容易出現在大型語言模型上。因為這類模型是靠預測下一個字來生成內容,它優化的目標是讓句子讀起來順,至於內容對不對,模型內部並沒有一套獨立的查證機制,所以在缺乏資料的地方就可能生成看似合理但不存在的內容。
為什麼 AI 幻覺突然這麼紅?
因為 ChatGPT 在 2022 年底開放給大眾之後,大量幻覺案例被一般使用者親眼看到。劍橋詞典在 2023 年把 hallucinate 選為年度代表字並新增 AI 相關定義,2023 年美國 Mata v. Avianca 案與 2024 年加拿大 Moffatt v. Air Canada 案則讓這個問題正式進入法律層面。
我不是工程師也需要懂 AI 幻覺嗎?
需要。如果你會用 AI 查資料、寫報告或做決定,理解幻覺會讓你知道哪些內容必須自己再驗一次。最實際的判準是:越具體、越可查證的資訊,例如數字、人名、日期、引用來源,就越需要自己確認過才能用。
AI 幻覺的中文翻譯有沒有統一?
台灣主要使用「AI 幻覺」,這也是本站採用的譯法。「幻覺」是直譯自 hallucination,偶爾也會看到「AI 產生幻覺」「模型幻覺」等說法,指的是同一件事。英文原詞 hallucination 在技術文件中仍被廣泛沿用,另有學者主張改用 confabulation(虛談)更精確,但目前尚未成為主流用法。
學會 AI 幻覺之後,下一個該學什麼?
建議接著看 RAG,那是目前對付幻覺最常見的工程手段;再看提示詞,因為問法會直接影響 AI 亂編的機率。如果你在用會自己動手做事的 AI,也可以回頭補 AI Agent 這個詞,因為幻覺一旦發生在會執行動作的系統上,後果會比講錯話嚴重得多。
延伸閱讀
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — 幻覺的源頭,先搞懂模型怎麼生成文字比較好理解。
- AI Agent 是什麼?不只回答問題,還會幫你動手把事做完 — 當會亂講話的模型被交付執行權限,風險長什麼樣子。
- Meta 首度開賣 AI 模型,3 巨頭同週搶攻超級 App — 裡面提到 Grok 4.5 成本砍近八成、幻覺率從 25% 翻到 54% 的取捨。
- Kimi K3 挾 2.8 兆參數登場,中美 AI 攻防 3 大動態 — Gemini 3.5 Pro 因為幻覺頻繁、品質不達標而延後上線的來龍去脈。
參考來源
- Why Language Models Hallucinate(OpenAI, 2025-09) — 評測獎勵猜測、模型缺乏誠實棄答誘因的核心論點。
- Why Language Models Hallucinate(arXiv:2509.04664) — 論文本體,作者群與「生成錯誤率至少是分類錯誤率兩倍」的推導出處。
- Mata v. Avianca, Inc. 裁定書(Justia) — 2023 年 6 月 22 日紐約南區聯邦地方法院對律師處以 5,000 美元罰款的原始裁定。
- Air Canada found liable for chatbot’s bad advice(CBC News) — Moffatt v. Air Canada 案的判決日期、賠償金額與加航的抗辯內容。
- 法官開酸「不要用 AI 寫上訴狀」(聯合新聞網) — 桃園地院法官孫健智判決附註的原文與案件背景。
- Introducing the Next Generation of Vectara’s Hallucination Leaderboard — HHEM 評分方式、0.5 判定門檻與 7,700 篇文章資料集的說明。
整理一下重點:AI 幻覺真的不是模型壞掉,是它被教成一個「寧可猜也不要空白」的考生,所以最後一關必須是你自己。
希望這一篇有讓你對 AI 幻覺有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。