AI 说人话:RAG 就是给 AI 配一个能翻的书包
· AI Hot 编辑部
概念翻译 · RAG 听着像黑话,做的事很朴素:AI 开口回答之前,先让它翻资料。这篇用开卷考试把它拆成四步,讲清楚它为什么不消灭幻觉、只是给幻觉搬了个家,以及三种你压根不需要 RAG 的情况。
RAG 全称检索增强生成,翻译成人话一句话:AI 回答之前先去翻资料,翻到什么就照着什么答。没有它的时候,模型只能靠训练时记下的东西回你;有了它,模型是看着你那本手册回答你。
1. 拆成四步,比想象的朴素
整个 RAG 就四步,工程量全在细节里,概念本身没什么玄学:
1. 切(chunk):把你的文档切成一段一段。太大切不中重点,太小上下文断裂。
2. 找(retrieve):拿你的问题去检索,挑回最相关的几段。
3. 排(rerank):再排一遍顺序,把最该被模型看到的放最前面。
4. 塞(prompt):这几段加上你的问题,一起塞进模型窗口,让它照着答。
四步里只有第 4 步是模型在干活,前三步都是普通的检索工程。很多人一听 RAG 觉得「这是 AI 的一部分」,其实七成是搜索问题。
顺带说清它贵在哪。RAG 不是免费的:资料要切要存要建索引(一次性成本),每次提问都要跑一遍检索(每次成本),检索出来的那几段还要跟着一起进模型窗口,等于每一次提问都在为「翻书」这件事额外付模型钱。资料越多、问得越频繁,这两笔账越明显。所以上不上 RAG,本质是个「准度值不值这个钱」的问题,不是「上了会不会更聪明」的问题。
2. RAG 不消灭幻觉,它给幻觉搬了个家
这是最该记住的一条。RAG 确实能改善一件事:模型回答时有没有资料可依。资料在手,胡编的原材料就少了。
但它不解决另一件事:检索会出错。检索错了会发生什么?最糟的情况不是模型答不出来,是它自信地答错——从错误的段落里组织出一段看着非常像样的话,而且引用还在、格式还特别规范,你更难察觉。
所以用 RAG 的产品里发现答案不对时,先去看它引的那几段原文,而不是先怀疑模型或急着换更大的模型。多数时候,错在检索,不在生成。这也是为什么「换个更强的模型试试」经常没用。
3. 什么时候你根本不需要 RAG
1. 你的资料就几页,一整份塞进窗口都放得下——那直接塞,RAG 是自己给自己加一个故障点。
2. 你只是想让模型基于你刚贴的那段文字回答——它已经在窗口里了。
3. 你要的是「最新」而不是「准确」——RAG 的知识有更新延迟,先问日期,比问检索更靠谱。
4. 你的资料一天之内更新好几次——RAG 有建索引的延迟,越实时越不靠谱;这种场景直接用工具实时去取,比让模型翻书快也准。
4. 普通用户和 builder 怎么办
普通用户,三条:
1. 看到带引用的 AI 答案,顺手点开引用核对一次,尤其是数字和日期。
2. 提问时把范围收窄:「按这份 2024 版手册回答」比「我们公司流程是什么」靠谱得多。
3. 答案涉及钱、法务、对外承诺时,明确让它标出引的是哪一段。
builder,三条:
1. 上线前先评估:你的问题集里有多大比例,模型现在靠训练知识就能答对。比例高的话先别急着上 RAG。
2. 上了 RAG,先调检索,再调模型。检索不准的时候,换更强的模型往往一点效果都没有。
3. 兜底要做:检索结果为空或相似度太低时,直接返回「资料里没找到」,别让模型自由发挥——那正是幻觉最贵的时刻。
RAG 给模型配了书包,但书包里装哪本书还得你挑。挑错了,它不是不会答,是拿着错的书答得特别自信。