AI 知识库是怎么工作的?RAG 技术通俗解读
RAG(检索增强生成)是 AI 知识库的核心技术。了解 AI 如何基于你的笔记回答问题,以及它和直接用 ChatGPT 的区别。
当你问 ChatGPT 一个关于你个人笔记的问题时,它无法回答——因为它没有读过你的笔记。这就是 RAG(Retrieval-Augmented Generation,检索增强生成)要解决的问题:让 AI 在回答之前,先在你的知识库中检索相关内容,再基于检索结果生成回答。
RAG 的工作流程分为三步:第一步,将你的笔记转化为向量嵌入(Embedding)——把文字变成数学向量,语义相近的文字在向量空间中距离更近。第二步,当你提出问题时,把问题也转化为向量,在笔记向量库中找到最相关的几条笔记。第三步,把问题和检索到的笔记一起发给 AI 模型,让它基于这些真实材料来回答。
RAG 和直接用 ChatGPT 的关键区别在于"有据可查"。ChatGPT 的回答基于训练数据,你无法验证来源。RAG 的回答基于你的笔记,每条回答都可以追溯到具体的笔记出处。这就是钤记强调的"溯源验证"——AI 说的每句话,你都可以点击来源查看原文。
本地 RAG 是隐私友好的方案。传统 RAG 需要将笔记上传到云端进行向量化和检索。本地 RAG 则在你的设备上完成所有步骤——向量化用本地模型(如 Ollama + nomic-embed-text),检索在本地向量库中进行,只有最终的回答请求才发送到 AI 模型。你的笔记内容永远不会离开你的设备。
RAG 的效果取决于几个因素:第一,笔记质量——如果笔记本身是碎片化的、缺乏上下文的,AI 也很难给出好的回答。第二,分块策略——长笔记需要被切分成合适的片段进行向量化,太大或太小都会影响检索精度。第三,嵌入模型的质量——不同的模型对中文的理解能力差异很大,钤记默认使用针对中文优化的嵌入模型。
RAG 不是万能的。它擅长的事实性问答和知识检索,但不擅长创造性任务。如果你想让 AI 帮你写一首诗或编一个故事,直接用 ChatGPT 就够了。但如果你想知道"我上个月读的那篇关于分布式系统的文章核心观点是什么",RAG 才是正确的工具。
常见问题
RAG 和微调(Fine-tuning)有什么区别?
微调是修改 AI 模型本身的参数,让它"学会"特定领域的知识;RAG 不修改模型,而是在回答时动态检索相关资料。RAG 更灵活(知识可以随时更新)、更透明(可追溯来源),是目前知识库场景的主流方案。
本地部署 RAG 需要什么硬件?
基本配置:8GB 内存 + 支持 AVX2 的 CPU 即可运行轻量级嵌入模型。如果要用本地 LLM(如 Llama 3),建议 16GB 内存 + NVIDIA GPU。钤记的开源版支持纯 CPU 模式。
RAG 能处理图片和 PDF 吗?
可以。钤记支持对 PDF 文档进行 OCR 文字提取后向量化,也支持对图片进行描述生成后纳入检索范围。具体效果取决于文档质量。
想试试钤记?
开源免费,本地优先,一行命令部署。