解释企业RAG知识库从文档治理、切分、Embedding、向量检索、Reranker到答案引用和持续评测的完整部署链路。
先治理资料,再建立索引
同一制度的多个版本、扫描件、缺少日期的网页和权限不明的共享文件,会在检索阶段制造冲突。进入知识库前,应确认资料所有者、正式版本、适用部门、有效日期、保密等级和更新方式。
无法确认来源或已经失效的文档不应与正式制度同等进入检索。对图片、表格和扫描PDF,还要检查文字提取是否完整,不能因为文件上传成功就认为内容可用。
一条完整RAG链路
- 解析:提取正文、标题、表格、页码和文档属性。
- 切分:按语义与文档结构建立可引用片段,而不是机械固定长度。
- 向量化:使用Embedding模型把问题和片段转为可比较表示。
- 召回:结合向量、关键词和权限条件找到候选内容。
- 重排:用Reranker重新判断问题与候选段落的相关性。
- 生成:模型依据候选内容回答,并返回文档名、版本和具体位置。
Embedding与Reranker分工不同
Embedding适合从大量内容中快速召回可能相关的候选,Reranker则对较小候选集逐条评分。两者组合通常比只增加生成模型参数更容易诊断:召回不到应检查切分、查询和Embedding,召回正确但排序差应检查重排,证据正确但答案错误才重点检查生成提示与模型。
中文、英文、行业缩写和跨语言资料需要分别建立样本。公开榜单只能用于缩小候选范围,最终选择仍要看企业自己的问题与文档。
权限必须进入检索过程
如果系统先检索全部资料、最后才在界面隐藏来源,模型仍可能已经读取无权限内容。用户身份、部门、项目和文档等级应在召回前进入过滤条件,并在缓存、日志与导出中保持一致。
对人事、财务、客户和研发资料应设置更严格的访问、留存和审计规则。提示词要求模型保密不能替代真正的权限控制。
用问题集持续评测
- 正确答案必须能回到指定文档和具体段落。
- 同时测试能够回答、资料不足、资料冲突和无权访问的问题。
- 分别计算召回是否命中、重排是否前置、引用是否支持和最终答案是否正确。
- 文档更新后重新建立索引,并复查旧版本是否仍被召回。
- 保存人工纠正原因,区分资料问题、检索问题和生成问题。
参考资料
- Qwen3 Embedding官方模型卡https://huggingface.co/Qwen/Qwen3-Embedding-4B
- BGE-M3官方模型卡https://huggingface.co/BAAI/bge-m3
- Qwen3 Reranker官方模型卡https://huggingface.co/Qwen/Qwen3-Reranker-4B
- BGE Reranker官方模型卡https://huggingface.co/BAAI/bge-reranker-v2-m3
模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。
请通过内容更正页联系我们,并附上对应官方页面。