从业务任务、语言、模型类型、参数规模、量化精度、上下文和许可证选择Qwen、DeepSeek、Llama及检索模型。
配置参考
用于第一轮方案筛选
| 任务 | 需要的模型 | 先看什么 |
|---|---|---|
| 通用问答与写作 | Instruct生成模型 | 语言、事实、格式与延迟 |
| 复杂推理与代码 | 推理或代码模型 | 正确率、输出长度与超时 |
| 知识库召回 | Embedding | 命中率、语种、维度与吞吐 |
| 候选文档排序 | Reranker | 前列命中、候选数量与延迟 |
| 图片理解 | 多模态模型 | 图片类型、文字识别与显存 |
表中显存是规划区间,不是兼容保证;上下文、并发、量化格式和推理框架都会改变实际占用。
把任务拆成可测量能力
通用问答、中文写作、代码生成、复杂推理、图片理解、知识库检索和文本重排需要不同模型。先为每种任务准备真实输入、参考答案、允许的表达范围与错误等级,再选择两到四个候选运行。
对企业项目而言,事实正确、引用支持、结构遵循、权限拒答和稳定输出通常比公开榜单的单一总分更重要。高风险任务还要记录人工复核与升级路径。
看懂模型名称与类型
- Base模型适合继续训练研究,不一定适合直接对话。
- Instruct或Chat模型经过指令训练,更适合问答与助手应用。
- Dense模型每次调用全部参数,容量与显存较容易估算。
- MoE模型每次激活部分参数,但完整权重仍可能很大。
- Embedding负责召回,Reranker负责候选重排,不能当作生成模型互换。
参数、精度和上下文一起看
小模型成本低、响应快,适合边界清楚的分类、抽取或固定知识问答;中型模型在质量与硬件之间更平衡;大型或MoE模型通常需要多卡与更成熟的运维。量化能够降低显存,但必须检查行业词、数字、格式和长文档任务是否退化。
模型标注的最大上下文是能力上限,不是建议每次都使用。更长上下文会增加显存、等待和检索噪声,知识库通常仍需要先找到相关片段。
许可证与获取条件进入第一轮筛选
不同家族甚至同一家族的不同版本可能使用Apache、MIT、社区许可证或单独模型协议。有些仓库需要登录并接受条款。商业使用、再分发、托管服务、品牌署名与受限用途要逐项查看当前模型卡和许可证。
本站的推荐链接用于定位正式资料,不能替代企业法务审阅。下载时固定版本并保存条款副本,避免模型升级后无法还原当时适用条件。
一张最小评测表
- 质量:正确、完整、引用支持、格式遵循和拒答是否达标。
- 性能:首字延迟、输出速度、峰值并发与显存占用。
- 稳定:相同问题多次运行是否出现不可接受的差异。
- 安全:越权请求、提示注入和敏感内容处理是否符合要求。
- 成本:硬件、云资源、电力、运维与人工复核的总成本。
参考资料
- Qwen官方模型组织https://huggingface.co/Qwen
- DeepSeek官方模型组织https://huggingface.co/deepseek-ai
- Meta Llama官方模型组织https://huggingface.co/meta-llama
- NVIDIA显存估算说明https://docs.nvidia.com/nim/large-language-models/latest/troubleshooting/memory.html
模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。
请通过内容更正页联系我们,并附上对应官方页面。