解释Reranker如何重新排序知识库候选文档,比较Qwen3 Reranker与BGE Reranker的规格、部署成本和评测方式。
推荐链接
从正式来源开始
高频重排可先从较小规格验证。
打开官方页面 →官方入口Qwen3 Reranker 4B在困难负样本上比较是否明显改善排序。
打开官方页面 →官方入口BGE Reranker v2-m3多语言重排候选,官方权重为safetensors。
打开官方页面 →外部仓库可能更新。下载前请重新查看当前模型卡、文件列表和许可证。
配置参考
用于第一轮方案筛选
| 候选 | 规格 | 硬件起点 | 使用建议 |
|---|---|---|---|
| Qwen3 Reranker 0.6B | 0.6B | CPU或小型GPU | 先测高频请求和批处理 |
| Qwen3 Reranker 4B | 4B | 单卡GPU | 只在排序收益明显时升级 |
| Qwen3 Reranker 8B | 8B | 较大单卡或多卡 | 控制候选数量和片段长度 |
| BGE Reranker v2-m3 | 约2.29GB仓库 | CPU或小型GPU | 多语言重排基线 |
表中显存是规划区间,不是兼容保证;上下文、并发、量化格式和推理框架都会改变实际占用。
重排解决什么问题
Embedding通常从大量文档中快速找到几十个候选,但向量相似并不总等于能够回答问题。Reranker同时读取查询与候选片段,为每一对内容打分,再把更可能支持答案的段落放到前面。
重排只处理已经召回的候选。如果正确资料没有进入候选集,Reranker无法找回;如果资料版本错误,它也不能自动知道哪份才是企业正式版本。
两个常见选择
- Qwen3 Reranker:官方提供0.6B、4B和8B规格,适合按质量与延迟选择。
- BGE Reranker v2-m3:多语言Cross-Encoder模型,官方safetensors文件约2.27GB。
- 小模型适合高频或CPU受限场景,大模型应先证明排序收益。
- Reranker与Embedding可以来自不同家族,但必须在同一检索测试集上联合评测。
配置和并发特点
Reranker需要对每个查询与多个候选逐对计算。候选从20条增加到100条,会直接放大推理次数和等待时间。实际容量取决于候选数量、片段长度、批处理和并发,不应只按模型文件大小购买硬件。
可以先用0.6B级模型建立基线,再比较4B或8B是否显著提高关键问题的前列命中。对大多数应用,减少无关候选、改善切分和元数据过滤也可能比扩大重排模型更有效。
怎样评测重排效果
- 统计正确片段在重排前后的名次变化。
- 观察Top 3或Top 5是否包含足够支持答案的资料。
- 加入看似相关但结论相反、已经过期或属于其他产品的困难负样本。
- 分别测试中文、英文、缩写、数字和长查询。
- 同时记录查询延迟、GPU占用和每次请求的候选数量。
上线时保持链路可解释
日志中应能够追溯原始查询、召回候选、重排分数、最终送给生成模型的片段以及用户权限。分数用于排序,不应直接解释为事实正确概率。
模型或阈值变化后,要使用固定测试集回归,并检查无答案问题是否被错误强行匹配。需要时设置最低相关性与资料不足分支,让系统在证据不够时明确拒答。
参考资料
- Qwen3 Reranker 0.6Bhttps://huggingface.co/Qwen/Qwen3-Reranker-0.6B
- Qwen3 Reranker 4Bhttps://huggingface.co/Qwen/Qwen3-Reranker-4B
- BGE Reranker v2-m3https://huggingface.co/BAAI/bge-reranker-v2-m3
模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。
请通过内容更正页联系我们,并附上对应官方页面。