Embedding、RAG 与知识库
为什么模型需要知识库
Section titled “为什么模型需要知识库”模型的训练资料不一定包含你的内部文档、最新产品说明或客户数据。把全部资料直接粘贴进每次对话既浪费上下文,也难以维护。
RAG(Retrieval-Augmented Generation,检索增强生成)的思路是:先从你的资料中找到相关片段,再把这些片段交给模型回答。
文档 → 切成片段 → 生成 Embedding → 保存索引用户问题 → 生成 Embedding → 找到相似片段 → 交给模型生成回答Embedding 是什么
Section titled “Embedding 是什么”Embedding 是把文字、图片等内容转换成一串数字(向量)。语义相近的内容,在向量空间里通常更接近,因此可以用相似度搜索找到相关资料。
它不是“把文档变成模型记忆”,也不会自动判断内容是否正确。原文、权限、更新时间和检索策略仍然很重要。
RAG 的四个关键环节
Section titled “RAG 的四个关键环节”1. 准备资料
Section titled “1. 准备资料”清理过时版本、重复内容和无关附件,为文档加上标题、来源、更新时间和访问范围。
2. 合理分段
Section titled “2. 合理分段”按标题、段落和语义切分,而不是机械地每 N 个字符截断。片段过小会失去上下文,过大则会降低检索精度并占用更多 Token。
3. 检索和排序
Section titled “3. 检索和排序”可以结合关键词搜索、向量搜索和重排。只找到“字面相似”的内容还不够,要检查它是否真的回答了问题。
4. 生成并标注来源
Section titled “4. 生成并标注来源”把检索到的片段、来源和回答规则一起传给模型。让回答只基于资料;找不到时明确说“资料中没有”,不要猜。
什么时候值得使用
Section titled “什么时候值得使用”适合:
- 产品帮助中心、内部流程、知识库问答;
- 经常更新的政策、价格、版本和操作手册;
- 需要给出原文出处的研究或客服场景。
不一定适合:
- 资料很少且可以直接放进提示词;
- 问题本身需要创造、推理或写作,而不是查资料;
- 文档没有整理、没有权限边界,先做检索只会放大混乱。
新手常见误区
Section titled “新手常见误区”- 以为加上向量数据库就能解决所有幻觉;
- 不保存来源,回答无法追溯;
- 把不同权限用户的文档混在同一检索范围;
- 文档更新后不重建索引;
- 只用一个测试问题,没覆盖错配、空结果和过期内容。
一个可执行的最小方案
Section titled “一个可执行的最小方案”先用 20~50 篇高质量文档做小范围试验:为每个片段保留标题和 URL,准备 10 个真实问题,记录“是否找到正确片段、回答是否有来源、是否泄露不该看到的内容”。通过后再扩大数据量和自动化程度。