用参数量、精度、上下文、并发和推理框架估算大模型服务器配置,理解权重显存、KV缓存、系统内存和存储空间的区别。
配置参考
用于第一轮方案筛选
| 使用阶段 | 候选模型 | GPU显存规划 | 系统内存 | 说明 |
|---|---|---|---|---|
| 个人验证 | 3B–8B INT4 | 8–12GB起步 | 16–32GB | 适合低并发;先确认格式与速度 |
| 工作组 | 7B–14B INT4或8B BF16 | 16–24GB级 | 32–64GB | 为上下文和运行开销留空间 |
| 部门服务 | 14B–32B量化 | 24–48GB以上 | 64–128GB | 必须按峰值并发实测 |
| 企业多卡 | 70B或大型MoE | 80GB级多卡规划 | 128GB以上 | 互联、供电和故障恢复同样重要 |
表中显存是规划区间,不是兼容保证;上下文、并发、量化格式和推理框架都会改变实际占用。
使用显存规划计算器,先计算权重下限与每卡预留。
权重显存是起点,不是最终配置
基础估算可以使用“参数量×每个参数的字节数”。BF16和FP16通常按2字节,FP8按1字节,INT4按0.5字节估算;多卡张量并行时,再除以参与切分的GPU数量。这个结果只代表模型权重,不包含KV缓存、激活值、通信缓冲、CUDA图和框架开销。
例如8B模型的BF16权重约16GB,运行时不能据此认定16GB显卡一定足够。模型架构、上下文长度、并发请求和推理框架都会占用额外显存。采购时应把计算结果视为筛选下限,再用目标工作负载实测。
精度与量化怎样影响选择
- BF16或FP16:保留较完整精度,权重约为每参数2字节。
- FP8或INT8:权重约减半,但需要确认硬件和推理框架支持。
- INT4:适合显存有限的本地部署,质量和速度必须使用真实任务验证。
- 同为4位量化,不同格式、量化方法和运行框架的效果并不相同。
- 不要从第三方文件名推断许可证、上下文或聊天模板。
上下文和并发决定KV缓存压力
同一个模型,4K上下文单用户演示与32K上下文多用户服务可能需要完全不同的显存。输入与输出越长、同时生成的序列越多,KV缓存占用通常越高。降低最大上下文、限制并发或缩短输出可以缓解压力,但也会改变产品能力。
容量测试应至少覆盖日常长度、峰值长度、平均并发和峰值并发,并分别记录首字延迟、生成速度、排队时间与显存峰值。只测每秒Token数无法判断用户是否会长时间等待。
不要忽略CPU、内存、存储和网络
- 系统内存要容纳操作系统、容器、模型加载过程、缓存和其他服务。
- 磁盘要为原始权重、量化版本、镜像、日志和回滚版本预留空间。
- NVMe会明显改善模型加载、更新和本地缓存体验。
- 多卡服务器要检查PCIe、NVLink或其他互联方式与实际并行策略。
- 机架功率、散热、冗余电源和网络带宽必须进入采购验收。
采购前做一次可复现的压力测试
固定模型版本、量化格式、推理框架、最大上下文和并发脚本,在候选硬件上连续运行。测试数据要包含短问答、长文档、检索增强和结构化输出,而不是只跑厂商演示。
验收时同时观察错误率、显存不足、服务重启、长请求挤占、温度降频和模型加载时间。满足一次峰值并不等于可以长期运营,生产容量还要保留升级、故障和流量突增空间。
参考资料
- NVIDIA显存计算与常见OOM原因https://docs.nvidia.com/nim/large-language-models/latest/troubleshooting/memory.html
- vLLM支持的硬件平台https://docs.vllm.ai/en/stable/getting_started/installation/
模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。
请通过内容更正页联系我们,并附上对应官方页面。