本地知识库搭建指南:用 Ollama 跑一个断网可用的 AI 问答
手把手教你搭建本地 AI 知识库:Ollama 装模型、资料入库、RAG 检索问答,全程断网可用。不想折腾的可以直接用钤记一键安装。
本地知识库 = 你的资料(笔记、PDF、网页剪藏)存在本机 + AI 在本机运行 + 提问时 AI 只检索你的资料回答。好处是三个:数据不出本机(隐私)、断网可用(稳定)、无订阅费(本地模型免费)。
核心技术栈是 Ollama(本地跑开源模型的运行时)+ RAG(检索增强生成:先在你的资料里搜相关段落,再让模型基于这些段落回答)。自己从零搭建需要:装 Ollama、拉模型、写文档切分、向量嵌入、检索融合、对话接口——对非工程师是劝退级的。
不想折腾的直接用钤记:桌面端安装包内嵌完整后端,双击即用。模型管家会检测你的硬件(内存/显卡),推荐合适档位:8G 内存推荐 Qwen 2.5 3B,16G 推荐 7B,32G 可以上 14B。一键下载、自动保活,不用碰命令行。
想自己折腾的最小路径:1) 装 Ollama(ollama.com 一键安装);2) 拉模型 ollama pull qwen2.5:3b;3) 拉嵌入模型 ollama pull nomic-embed-text;4) 选一个知识库前端(钤记开源版/AnythingLLM 等)指向本地 Ollama 即可。
几个实测经验:嵌入模型比对话模型更影响检索质量,别省;3B 是本地模型的可用下限,0.5B 只能算玩具;纯 CPU 跑 7B 的生成速度大约每秒 10-20 token,可接受但不算快;中文场景优先选 Qwen 系列。
常见问题
本地知识库需要什么配置?
最低 8G 内存跑 3B 模型,16G 推荐 7B。有独立显卡更好但不是必须,纯 CPU 也能跑(速度稍慢)。存储占用:3B 模型约 2GB,7B 约 4.5GB。
本地模型和 GPT-4 差距大吗?
在「基于你的资料问答」这个场景,差距比想象小:因为答案内容来自检索到的你的资料,模型主要做阅读理解和改写。3B-7B 的 Qwen 在这个任务上完全可用。
完全不懂技术能搭本地知识库吗?
可以。用钤记桌面端:下载安装包双击安装,模型管家自动检测硬件、推荐并一键下载模型,全程不需要碰命令行。
想试试钤记?
开源免费,本地优先,一行命令部署。