先说结论

解释企业RAG知识库从文档治理、切分、Embedding、向量检索、Reranker到答案引用和持续评测的完整部署链路。

01

先治理资料,再建立索引

同一制度的多个版本、扫描件、缺少日期的网页和权限不明的共享文件,会在检索阶段制造冲突。进入知识库前,应确认资料所有者、正式版本、适用部门、有效日期、保密等级和更新方式。

无法确认来源或已经失效的文档不应与正式制度同等进入检索。对图片、表格和扫描PDF,还要检查文字提取是否完整,不能因为文件上传成功就认为内容可用。

02

一条完整RAG链路

  • 解析:提取正文、标题、表格、页码和文档属性。
  • 切分:按语义与文档结构建立可引用片段,而不是机械固定长度。
  • 向量化:使用Embedding模型把问题和片段转为可比较表示。
  • 召回:结合向量、关键词和权限条件找到候选内容。
  • 重排:用Reranker重新判断问题与候选段落的相关性。
  • 生成:模型依据候选内容回答,并返回文档名、版本和具体位置。
03

Embedding与Reranker分工不同

Embedding适合从大量内容中快速召回可能相关的候选,Reranker则对较小候选集逐条评分。两者组合通常比只增加生成模型参数更容易诊断:召回不到应检查切分、查询和Embedding,召回正确但排序差应检查重排,证据正确但答案错误才重点检查生成提示与模型。

中文、英文、行业缩写和跨语言资料需要分别建立样本。公开榜单只能用于缩小候选范围,最终选择仍要看企业自己的问题与文档。

04

权限必须进入检索过程

如果系统先检索全部资料、最后才在界面隐藏来源,模型仍可能已经读取无权限内容。用户身份、部门、项目和文档等级应在召回前进入过滤条件,并在缓存、日志与导出中保持一致。

对人事、财务、客户和研发资料应设置更严格的访问、留存和审计规则。提示词要求模型保密不能替代真正的权限控制。

05

用问题集持续评测

  • 正确答案必须能回到指定文档和具体段落。
  • 同时测试能够回答、资料不足、资料冲突和无权访问的问题。
  • 分别计算召回是否命中、重排是否前置、引用是否支持和最终答案是否正确。
  • 文档更新后重新建立索引,并复查旧版本是否仍被召回。
  • 保存人工纠正原因,区分资料问题、检索问题和生成问题。

参考资料

  1. Qwen3 Embedding官方模型卡https://huggingface.co/Qwen/Qwen3-Embedding-4B
  2. BGE-M3官方模型卡https://huggingface.co/BAAI/bge-m3
  3. Qwen3 Reranker官方模型卡https://huggingface.co/Qwen/Qwen3-Reranker-4B
  4. BGE Reranker官方模型卡https://huggingface.co/BAAI/bge-reranker-v2-m3

模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。

配置数字与官方资料有变化?

请通过内容更正页联系我们,并附上对应官方页面。