一句話定義
RAG(Retrieval-Augmented Generation,中文譯為檢索增強生成)是讓 AI 在回答之前先去外部資料庫檢索相關內容,再根據檢索到的資料生成答案的技術。
30 秒看重點
- 是什麼:RAG 是「先查資料、再開口」的一套流程,模型本身完全不用重新訓練。
- 為什麼重要:它讓 AI 講得出你公司內部的規定、講得出昨天發生的事,而且答案可以附出處讓你自己查。
- 跟誰相關:想把內部文件餵給 AI 的老闆、要做客服機器人的工程師,還有每天在用 NotebookLM、Perplexity 查資料的一般使用者。
- 最常見的誤解:以為接了 RAG,AI 就不會再亂講話了。
- 記住這件事就夠了:RAG 改的是「模型看到什麼」,不是「模型本身」。
RAG 到底是什麼?
RAG 是讓 AI 回答問題之前,先去一個指定的資料來源裡把相關內容撈出來,再照著撈到的東西作答的技術。全名 Retrieval-Augmented Generation,中文通稱檢索增強生成。關鍵字是「先檢索、後生成」,順序不能反。
這個詞不是行銷部門想出來的,它出自一篇 2020 年 5 月 22 日掛上 arXiv 的論文《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》(編號 2005.11401),第一作者是 Patrick Lewis,共十二位作者,後來收進 NeurIPS 2020。Hugging Face 的 Transformers 官方文件對它的描述很精準:把一個預訓練語言模型(論文稱為 parametric memory,參數記憶)跟一個外部資料來源(non-parametric memory,非參數記憶)透過預訓練的神經檢索器接起來。當年論文的實作,外部資料來源就是整個維基百科的密集向量索引。
翻成白話:模型腦袋裡背的東西叫參數記憶,外面那本可以隨時換頁的資料叫非參數記憶。RAG 做的事情,就是幫模型配一本可以隨時翻的資料。
生活比喻:你可以想像成超商店員查 POS 機。客人問「這個活動還在不在?」,老鳥憑印象回你「應該還有吧」,聽起來很篤定,但檔期天天換,猜錯的機率其實不低。實務上店員會直接掃條碼、看螢幕、照螢幕上寫的回答你。RAG 就是幫 AI 裝上那台 POS 機,把「憑印象講」改成「查了再講」。
為什麼會有 RAG?
RAG 的出現,是為了解決大型語言模型(LLM)自己修不掉的兩個毛病:知識有截止日,還有它不知道的時候會自己編。
問題一是知識截止日。 模型訓練完就停止學習了,訓練資料收到哪天,它的認知就停在哪天。你問它上個月的政策、昨天的股價、公司上禮拜改的請假規則,它拿不到,只能用舊資料硬答。
問題二是幻覺。 模型在不確定的時候不會說「我不知道」,它會生出一段看起來合理、語氣還很肯定的內容。這件事我們在AI 幻覺那篇聊過,它跟「生成」這個動作是綁在一起的,換更大的模型也只會變少不會歸零。
還有問題三,也是企業最有感的: 模型再厲害,也沒看過你們公司的內部文件,因為那些東西本來就不在網路上。
RAG 的解法很土但很有效:既然模型記不住也不知道,那就每次回答前把正確資料塞到它眼前。它不用變聰明,它只要會照著唸就好。
RAG 是怎麼運作的?
三個步驟:先把資料切好存起來,提問時撈出最相關的幾塊,最後連同問題一起交給模型作答。LangChain 官方的 RAG 教學專案就是照「索引、檢索、生成」這三段拆的。
- 索引(Indexing):把你的文件切成一小塊一小塊(業界叫 chunk),每一塊丟進嵌入模型轉成一串數字(向量),存進向量資料庫。這步是事前做好的,跟使用者提問無關。
- 檢索(Retrieval):使用者問問題時,系統把這個問題同樣轉成向量,拿去跟資料庫裡的向量比對相似度,撈出最接近的幾塊內容。
- 生成(Generation):把撈到的那幾塊內容跟原本的問題一起寫進提示詞,交給模型。模型看著這些資料回答,而不是憑記憶回答。
名詞小教室:這裡出現兩個配套術語。嵌入(Embedding) 就是把一段文字轉成一組座標,意思接近的文字座標也會靠在一起,所以電腦才有辦法「算」出哪段話跟你的問題比較像。向量資料庫則是專門存這些座標、而且能快速找出最近鄰居的資料庫。這兩個詞我們之後會各寫一篇,先記得它們是 RAG 的左右手就行。
老實講,早期這套做法(研究圈稱為 Naive RAG,樸素 RAG)問題不少。一篇被大量引用的綜述論文《Retrieval-Augmented Generation for Large Language Models: A Survey》(編號 2312.10997)就把 RAG 的演進分成 Naive、Advanced、Modular 三代,並指出進階做法會在檢索前加上查詢改寫、路由與擴展,檢索後再加上重新排序與上下文壓縮,用來對付「Lost in the Middle」這種相關資料明明撈到了、卻剛好卡在提示詞中段被模型忽略的狀況。
RAG 跟微調(Fine-tuning)差在哪?
一句話:RAG 是讓 AI 開卷考,微調是讓 AI 重念一次書。前者改的是它看到的資料,後者改的是它腦袋裡的權重。
| 比較項目 | RAG(檢索增強生成) | Fine-tuning(微調) |
|---|---|---|
| 改動的東西 | 模型不動,只換它看到的資料 | 直接改模型權重 |
| 資料更新 | 換掉資料庫裡的檔案就生效 | 要重新訓練一輪 |
| 答案能附出處嗎 | 可以,撈到哪份文件就標哪份 | 不行,知識已經化進權重裡 |
| 最適合什麼 | 事實、法規、內部文件這類會變的知識 | 語氣、格式、特定寫作風格 |
| 我會在什麼情況選它 | 想讓 AI 知道公司最新規定 | 想讓 AI 每次都用同一種格式回話 |
從這張表可以看出來,這兩個東西根本不是二選一的競爭關係。如果你的需求是「讓 AI 讀得到我們最新的文件」,那是 RAG 的事;如果是「讓 AI 每次都用我要的口吻跟格式回答」,那才輪到微調。多數實際上線的系統其實兩個都用,事實交給 RAG、語氣交給微調。
你會在哪些 AI 工具看到 RAG?
RAG 早就不是實驗室裡的東西了,你每天在用的幾個工具背後跑的就是它。
- NotebookLM:Google 出的資料整理工具,它的定位就是「來源限定」,只根據你上傳的檔案回答,而且每一句都掛引用讓你點回原文。這是最典型的封閉式 RAG。
- Perplexity:走的是先檢索、再寫作的路線,回答上方直接列出它讀了哪幾個網頁。
- 企業客服機器人:你在銀行、電信官網上問到的那種,多半是把 FAQ 與規章文件建成索引,讓 AI 照著答,才不會自己發明一個不存在的優惠方案。加拿大航空的客服機器人就編過一個不存在的喪親折扣流程,2024 年 2 月被卑詩省民事解決法庭判賠 812.02 加幣。
如果你是工程師,你最常碰到 RAG 的地方會是 LangChain、LlamaIndex 這類框架,加上一個向量資料庫。想再往上走的話,微軟研究院開源的 GraphRAG(論文編號 2404.16130)是另一條路,它先用 LLM 把非結構化文字抽成知識圖譜再檢索,處理「跨多份文件才答得出來」的問題會比單純比對相似度好。
學 RAG 最常見的 3 個誤解
- 誤解一:接了 RAG 就不會有幻覺 — 真相是它只能壓低幻覺,消不掉。模型還是可能把撈到的資料讀歪、摘要錯,或把兩份文件的內容混在一起。撈錯資料的時候,它更會一本正經地照著錯的講。
- 誤解二:RAG 就是把整份文件貼給 AI 看 — 真相是那叫塞上下文,不叫 RAG。RAG 的重點在於「先切塊、再挑出最相關的幾塊」,挑這個動作才是它的核心。
- 誤解三:上下文視窗都幾百萬了,RAG 該退休了吧 — 真相是還沒有。Gemini 3.5 Pro 那則新聞提到 200 萬 Token 的上下文確實讓很多情境不用再拆文件,可是每次都把整份檔案塞進去,你就得每次都付整份的 Token 錢。「那企業為什麼不乾脆全塞?」因為帳單會很好看(誤)。2026 年的主流做法是混著用,先檢索縮小範圍,再用長上下文去讀。
想多了解 RAG,從哪開始?
如果你沒有技術背景:直接去用 NotebookLM,丟三份自己的檔案進去問問題,然後點開它給的每一個引用標記,你會很直觀地看懂「先查再答」跟「憑印象答」差在哪。
如果你是工程師:從 LangChain 的 rag-from-scratch 專案照著跑一次索引、檢索、生成三段,比看十篇介紹文有用。跑完之後再去讀那篇綜述論文,你會知道自己卡在哪一代。
常見問題 FAQ
RAG 跟 AI 有什麼關係?
RAG 是搭在大型語言模型外面的一層架構,用來補模型知識過期與亂編內容的問題。它本身不是一個模型,而是一套「先檢索、後生成」的流程,所以任何一個 LLM 都可以接上 RAG,換模型也不用重做資料。
為什麼 RAG 突然這麼紅?
因為它是企業把 AI 導進自家業務最快的路。企業真正想問 AI 的問題,答案幾乎都在自己的內部文件裡,而那些文件不可能拿去訓練公開模型。RAG 讓資料留在自己家、模型隨時可換,還能標出答案的出處供稽核,這三點對企業來說幾乎是必要條件。
我不是工程師也需要懂 RAG 嗎?
需要懂概念,不需要懂實作。如果你常用 AI 查資料,知道「這個工具有沒有真的去查」會直接改變你要不要相信它的答案。一個會附引用連結的回答,跟一個純憑模型記憶生出來的回答,可信度差很多。
RAG 的中文翻譯有沒有統一?
台灣繁體中文圈普遍使用「檢索增強生成」,這也是本站採用的譯法。實務上大多數人講話時還是直接說 RAG,中文翻譯多半只在正式文件裡出現,所以你在搜尋時用英文縮寫通常找得到更多資料。
學會 RAG 之後,下一個該學什麼?
建議接著看嵌入(Embedding)與向量資料庫,那是 RAG 檢索那一段的底層零件;再看提示詞注入,因為 RAG 把外部資料餵給模型的同時,也等於開了一個讓別人塞指令進來的門。這三個學完,你對 RAG 的理解就從「會用」變成「知道它哪裡會壞」。
延伸閱讀
- AI 幻覺是什麼?為什麼 ChatGPT 會一本正經地亂講話 — RAG 就是為了對付它而生的,先懂幻覺再看 RAG 會清楚很多。
- LLM 是什麼?大型語言模型如何撐起 ChatGPT、Claude 與 Gemini — RAG 是搭在 LLM 外面的架構,底層是同一件事。
- AI 的 Token 是什麼?一次搞懂 AI 計費單位與上下文上限 — 為什麼「整份塞進去」的成本會爆掉,答案在這篇。
- Gemini 3.5 Pro 鎖定 7/17,200 萬 Token 上下文搶先看 — 長上下文跟 RAG 的取捨,這則新聞是很好的對照。
參考來源
- Hugging Face Transformers 官方 RAG 模型文件 — 原始論文編號 2005.11401、2020 年 5 月 22 日發表,以及參數記憶與非參數記憶的架構描述。
- RAG-Survey:《Retrieval-Augmented Generation for Large Language Models: A Survey》整理 — Naive / Advanced / Modular 三代分類、查詢改寫與重新排序、Lost in the Middle 問題。
- LangChain rag-from-scratch — 索引、檢索、生成三階段的拆法與教學來源。
- Microsoft GraphRAG — 微軟研究院的知識圖譜式 RAG,論文編號 2404.16130。
- Facebook Research DPR(Dense Passage Retrieval) — 2020 年 EMNLP 論文,雙編碼器密集檢索,是 RAG 檢索那一段的基礎。
整理一下重點:RAG 真的不是讓 AI 變聰明,它只是逼 AI 查了再講,而這件事對降低亂講話的幫助大得超乎想像。
希望這一篇有讓你對檢索增強生成有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。
我們下篇文章見囉~
本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。