一句話定義

RAG(Retrieval-Augmented Generation,中文譯為檢索增強生成)是讓 AI 在回答之前先去外部資料庫檢索相關內容,再根據檢索到的資料生成答案的技術。

30 秒看重點

  • 是什麼:RAG 是「先查資料、再開口」的一套流程,模型本身完全不用重新訓練。
  • 為什麼重要:它讓 AI 講得出你公司內部的規定、講得出昨天發生的事,而且答案可以附出處讓你自己查。
  • 跟誰相關:想把內部文件餵給 AI 的老闆、要做客服機器人的工程師,還有每天在用 NotebookLM、Perplexity 查資料的一般使用者。
  • 最常見的誤解:以為接了 RAG,AI 就不會再亂講話了。
  • 記住這件事就夠了:RAG 改的是「模型看到什麼」,不是「模型本身」。

RAG 到底是什麼?

RAG 是讓 AI 回答問題之前,先去一個指定的資料來源裡把相關內容撈出來,再照著撈到的東西作答的技術。全名 Retrieval-Augmented Generation,中文通稱檢索增強生成。關鍵字是「先檢索、後生成」,順序不能反。

這個詞不是行銷部門想出來的,它出自一篇 2020 年 5 月 22 日掛上 arXiv 的論文《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》(編號 2005.11401),第一作者是 Patrick Lewis,共十二位作者,後來收進 NeurIPS 2020。Hugging Face 的 Transformers 官方文件對它的描述很精準:把一個預訓練語言模型(論文稱為 parametric memory,參數記憶)跟一個外部資料來源(non-parametric memory,非參數記憶)透過預訓練的神經檢索器接起來。當年論文的實作,外部資料來源就是整個維基百科的密集向量索引。

翻成白話:模型腦袋裡背的東西叫參數記憶,外面那本可以隨時換頁的資料叫非參數記憶。RAG 做的事情,就是幫模型配一本可以隨時翻的資料。

生活比喻:你可以想像成超商店員查 POS 機。客人問「這個活動還在不在?」,老鳥憑印象回你「應該還有吧」,聽起來很篤定,但檔期天天換,猜錯的機率其實不低。實務上店員會直接掃條碼、看螢幕、照螢幕上寫的回答你。RAG 就是幫 AI 裝上那台 POS 機,把「憑印象講」改成「查了再講」。

為什麼會有 RAG?

RAG 的出現,是為了解決大型語言模型(LLM)自己修不掉的兩個毛病:知識有截止日,還有它不知道的時候會自己編。

問題一是知識截止日。 模型訓練完就停止學習了,訓練資料收到哪天,它的認知就停在哪天。你問它上個月的政策、昨天的股價、公司上禮拜改的請假規則,它拿不到,只能用舊資料硬答。

問題二是幻覺。 模型在不確定的時候不會說「我不知道」,它會生出一段看起來合理、語氣還很肯定的內容。這件事我們在AI 幻覺那篇聊過,它跟「生成」這個動作是綁在一起的,換更大的模型也只會變少不會歸零。

還有問題三,也是企業最有感的: 模型再厲害,也沒看過你們公司的內部文件,因為那些東西本來就不在網路上。

RAG 的解法很土但很有效:既然模型記不住也不知道,那就每次回答前把正確資料塞到它眼前。它不用變聰明,它只要會照著唸就好。

RAG 是怎麼運作的?

三個步驟:先把資料切好存起來,提問時撈出最相關的幾塊,最後連同問題一起交給模型作答。LangChain 官方的 RAG 教學專案就是照「索引、檢索、生成」這三段拆的。

  1. 索引(Indexing):把你的文件切成一小塊一小塊(業界叫 chunk),每一塊丟進嵌入模型轉成一串數字(向量),存進向量資料庫。這步是事前做好的,跟使用者提問無關。
  2. 檢索(Retrieval):使用者問問題時,系統把這個問題同樣轉成向量,拿去跟資料庫裡的向量比對相似度,撈出最接近的幾塊內容。
  3. 生成(Generation):把撈到的那幾塊內容跟原本的問題一起寫進提示詞,交給模型。模型看著這些資料回答,而不是憑記憶回答。

名詞小教室:這裡出現兩個配套術語。嵌入(Embedding) 就是把一段文字轉成一組座標,意思接近的文字座標也會靠在一起,所以電腦才有辦法「算」出哪段話跟你的問題比較像。向量資料庫則是專門存這些座標、而且能快速找出最近鄰居的資料庫。這兩個詞我們之後會各寫一篇,先記得它們是 RAG 的左右手就行。

老實講,早期這套做法(研究圈稱為 Naive RAG,樸素 RAG)問題不少。一篇被大量引用的綜述論文《Retrieval-Augmented Generation for Large Language Models: A Survey》(編號 2312.10997)就把 RAG 的演進分成 Naive、Advanced、Modular 三代,並指出進階做法會在檢索前加上查詢改寫、路由與擴展,檢索後再加上重新排序與上下文壓縮,用來對付「Lost in the Middle」這種相關資料明明撈到了、卻剛好卡在提示詞中段被模型忽略的狀況。

RAG 跟微調(Fine-tuning)差在哪?

一句話:RAG 是讓 AI 開卷考,微調是讓 AI 重念一次書。前者改的是它看到的資料,後者改的是它腦袋裡的權重。

比較項目RAG(檢索增強生成)Fine-tuning(微調)
改動的東西模型不動,只換它看到的資料直接改模型權重
資料更新換掉資料庫裡的檔案就生效要重新訓練一輪
答案能附出處嗎可以,撈到哪份文件就標哪份不行,知識已經化進權重裡
最適合什麼事實、法規、內部文件這類會變的知識語氣、格式、特定寫作風格
我會在什麼情況選它想讓 AI 知道公司最新規定想讓 AI 每次都用同一種格式回話

從這張表可以看出來,這兩個東西根本不是二選一的競爭關係。如果你的需求是「讓 AI 讀得到我們最新的文件」,那是 RAG 的事;如果是「讓 AI 每次都用我要的口吻跟格式回答」,那才輪到微調。多數實際上線的系統其實兩個都用,事實交給 RAG、語氣交給微調。

你會在哪些 AI 工具看到 RAG?

RAG 早就不是實驗室裡的東西了,你每天在用的幾個工具背後跑的就是它。

  • NotebookLM:Google 出的資料整理工具,它的定位就是「來源限定」,只根據你上傳的檔案回答,而且每一句都掛引用讓你點回原文。這是最典型的封閉式 RAG。
  • Perplexity:走的是先檢索、再寫作的路線,回答上方直接列出它讀了哪幾個網頁。
  • 企業客服機器人:你在銀行、電信官網上問到的那種,多半是把 FAQ 與規章文件建成索引,讓 AI 照著答,才不會自己發明一個不存在的優惠方案。加拿大航空的客服機器人就編過一個不存在的喪親折扣流程,2024 年 2 月被卑詩省民事解決法庭判賠 812.02 加幣。

如果你是工程師,你最常碰到 RAG 的地方會是 LangChain、LlamaIndex 這類框架,加上一個向量資料庫。想再往上走的話,微軟研究院開源的 GraphRAG(論文編號 2404.16130)是另一條路,它先用 LLM 把非結構化文字抽成知識圖譜再檢索,處理「跨多份文件才答得出來」的問題會比單純比對相似度好。

學 RAG 最常見的 3 個誤解

  1. 誤解一:接了 RAG 就不會有幻覺 — 真相是它只能壓低幻覺,消不掉。模型還是可能把撈到的資料讀歪、摘要錯,或把兩份文件的內容混在一起。撈錯資料的時候,它更會一本正經地照著錯的講。
  2. 誤解二:RAG 就是把整份文件貼給 AI 看 — 真相是那叫塞上下文,不叫 RAG。RAG 的重點在於「先切塊、再挑出最相關的幾塊」,挑這個動作才是它的核心。
  3. 誤解三:上下文視窗都幾百萬了,RAG 該退休了吧 — 真相是還沒有。Gemini 3.5 Pro 那則新聞提到 200 萬 Token 的上下文確實讓很多情境不用再拆文件,可是每次都把整份檔案塞進去,你就得每次都付整份的 Token 錢。「那企業為什麼不乾脆全塞?」因為帳單會很好看(誤)。2026 年的主流做法是混著用,先檢索縮小範圍,再用長上下文去讀。

想多了解 RAG,從哪開始?

如果你沒有技術背景:直接去用 NotebookLM,丟三份自己的檔案進去問問題,然後點開它給的每一個引用標記,你會很直觀地看懂「先查再答」跟「憑印象答」差在哪。

如果你是工程師:從 LangChain 的 rag-from-scratch 專案照著跑一次索引、檢索、生成三段,比看十篇介紹文有用。跑完之後再去讀那篇綜述論文,你會知道自己卡在哪一代。


常見問題 FAQ

RAG 跟 AI 有什麼關係?

RAG 是搭在大型語言模型外面的一層架構,用來補模型知識過期與亂編內容的問題。它本身不是一個模型,而是一套「先檢索、後生成」的流程,所以任何一個 LLM 都可以接上 RAG,換模型也不用重做資料。

為什麼 RAG 突然這麼紅?

因為它是企業把 AI 導進自家業務最快的路。企業真正想問 AI 的問題,答案幾乎都在自己的內部文件裡,而那些文件不可能拿去訓練公開模型。RAG 讓資料留在自己家、模型隨時可換,還能標出答案的出處供稽核,這三點對企業來說幾乎是必要條件。

我不是工程師也需要懂 RAG 嗎?

需要懂概念,不需要懂實作。如果你常用 AI 查資料,知道「這個工具有沒有真的去查」會直接改變你要不要相信它的答案。一個會附引用連結的回答,跟一個純憑模型記憶生出來的回答,可信度差很多。

RAG 的中文翻譯有沒有統一?

台灣繁體中文圈普遍使用「檢索增強生成」,這也是本站採用的譯法。實務上大多數人講話時還是直接說 RAG,中文翻譯多半只在正式文件裡出現,所以你在搜尋時用英文縮寫通常找得到更多資料。

學會 RAG 之後,下一個該學什麼?

建議接著看嵌入(Embedding)與向量資料庫,那是 RAG 檢索那一段的底層零件;再看提示詞注入,因為 RAG 把外部資料餵給模型的同時,也等於開了一個讓別人塞指令進來的門。這三個學完,你對 RAG 的理解就從「會用」變成「知道它哪裡會壞」。


延伸閱讀


參考來源

  1. Hugging Face Transformers 官方 RAG 模型文件 — 原始論文編號 2005.11401、2020 年 5 月 22 日發表,以及參數記憶與非參數記憶的架構描述。
  2. RAG-Survey:《Retrieval-Augmented Generation for Large Language Models: A Survey》整理 — Naive / Advanced / Modular 三代分類、查詢改寫與重新排序、Lost in the Middle 問題。
  3. LangChain rag-from-scratch — 索引、檢索、生成三階段的拆法與教學來源。
  4. Microsoft GraphRAG — 微軟研究院的知識圖譜式 RAG,論文編號 2404.16130。
  5. Facebook Research DPR(Dense Passage Retrieval) — 2020 年 EMNLP 論文,雙編碼器密集檢索,是 RAG 檢索那一段的基礎。

整理一下重點:RAG 真的不是讓 AI 變聰明,它只是逼 AI 查了再講,而這件事對降低亂講話的幫助大得超乎想像。

希望這一篇有讓你對檢索增強生成有比較具體的理解哩~如果發現事實錯誤、定義不準、或翻譯卡卡的,歡迎透過聯絡頁指正,看到我們會盡快修。

我們下篇文章見囉~

本條目由 Array 報報 AI 編輯部根據上方「參考來源」整理,文末已揭露 AI 生成 + 公開資料引用。