RAG 是什么?为什么它让 AI 不再「一本正经地胡说八道」
RAG(检索增强生成)是让 AI 基于你的真实资料回答的技术:先检索、再生成、带出处。三分钟看懂 RAG 的原理、优势和适用场景。
RAG(Retrieval-Augmented Generation,检索增强生成)是一种让 AI「开卷考试」的技术:你提问后,系统先从你的资料库里检索相关段落,再让大模型基于这些段落组织答案。和闭卷瞎编相比,RAG 的回答有事实依据、能标注出处。
为什么需要 RAG?因为大模型有两个先天缺陷:知识截止(训练数据有时间边界)和幻觉(不知道也会编)。直接问模型「我们公司的退货流程是什么」,它只能瞎编;走 RAG,它会先找到你员工手册里的那一条,再照着回答。
一个 RAG 系统的工作流程:1) 文档切分成小块;2) 嵌入模型把每块变成向量存库;3) 提问时把问题也变成向量,找出最相关的若干块;4) 把这些块连同问题一起交给大模型生成回答;5) 回答附上引用来源。
好的 RAG 不止向量检索。工程实践里关键词检索(BM25)和向量检索要融合——向量擅长语义相近,关键词擅长精确匹配(人名、编号、术语)。钤记采用关键词+向量 0.55/0.45 加权融合,并对经过人工核实的知识单元加权、对证伪内容直接剔除。
RAG 的适用场景非常广:企业内部知识库问答(SOP、手册)、法律/医疗文献检索、个人第二大脑、客服机器人。它的核心价值一句话:让 AI 的回答从「可能是编的」变成「可以点开出处验证的」。
常见问题
RAG 和微调(Fine-tuning)有什么区别?
微调是把知识「背进」模型,成本高、更新慢、还会记错;RAG 是让模型「查资料」,资料改了立刻生效,且每句回答能给出处。知识库场景优先选 RAG。
RAG 需要联网吗?
不一定。如果嵌入模型和大模型都是本地的(比如 Ollama 跑 Qwen),RAG 全流程可以断网运行——这正是本地知识库(如钤记)的方案。
RAG 的回答 100% 准确吗?
不是。检索可能找错段落,模型也可能误读。所以严肃场景要带验证机制:钤记会把 AI 生成的新知识标记为「待核实」,人工确认后才加权进入检索。
想试试钤记?
开源免费,本地优先,一行命令部署。