先说结论

用参数量、精度、上下文、并发和推理框架估算大模型服务器配置,理解权重显存、KV缓存、系统内存和存储空间的区别。

配置参考

用于第一轮方案筛选

使用阶段候选模型GPU显存规划系统内存说明
个人验证3B–8B INT48–12GB起步16–32GB适合低并发;先确认格式与速度
工作组7B–14B INT4或8B BF1616–24GB级32–64GB为上下文和运行开销留空间
部门服务14B–32B量化24–48GB以上64–128GB必须按峰值并发实测
企业多卡70B或大型MoE80GB级多卡规划128GB以上互联、供电和故障恢复同样重要

表中显存是规划区间,不是兼容保证;上下文、并发、量化格式和推理框架都会改变实际占用。

使用显存规划计算器,先计算权重下限与每卡预留。

01

权重显存是起点,不是最终配置

基础估算可以使用“参数量×每个参数的字节数”。BF16和FP16通常按2字节,FP8按1字节,INT4按0.5字节估算;多卡张量并行时,再除以参与切分的GPU数量。这个结果只代表模型权重,不包含KV缓存、激活值、通信缓冲、CUDA图和框架开销。

例如8B模型的BF16权重约16GB,运行时不能据此认定16GB显卡一定足够。模型架构、上下文长度、并发请求和推理框架都会占用额外显存。采购时应把计算结果视为筛选下限,再用目标工作负载实测。

02

精度与量化怎样影响选择

  • BF16或FP16:保留较完整精度,权重约为每参数2字节。
  • FP8或INT8:权重约减半,但需要确认硬件和推理框架支持。
  • INT4:适合显存有限的本地部署,质量和速度必须使用真实任务验证。
  • 同为4位量化,不同格式、量化方法和运行框架的效果并不相同。
  • 不要从第三方文件名推断许可证、上下文或聊天模板。
03

上下文和并发决定KV缓存压力

同一个模型,4K上下文单用户演示与32K上下文多用户服务可能需要完全不同的显存。输入与输出越长、同时生成的序列越多,KV缓存占用通常越高。降低最大上下文、限制并发或缩短输出可以缓解压力,但也会改变产品能力。

容量测试应至少覆盖日常长度、峰值长度、平均并发和峰值并发,并分别记录首字延迟、生成速度、排队时间与显存峰值。只测每秒Token数无法判断用户是否会长时间等待。

04

不要忽略CPU、内存、存储和网络

  • 系统内存要容纳操作系统、容器、模型加载过程、缓存和其他服务。
  • 磁盘要为原始权重、量化版本、镜像、日志和回滚版本预留空间。
  • NVMe会明显改善模型加载、更新和本地缓存体验。
  • 多卡服务器要检查PCIe、NVLink或其他互联方式与实际并行策略。
  • 机架功率、散热、冗余电源和网络带宽必须进入采购验收。
05

采购前做一次可复现的压力测试

固定模型版本、量化格式、推理框架、最大上下文和并发脚本,在候选硬件上连续运行。测试数据要包含短问答、长文档、检索增强和结构化输出,而不是只跑厂商演示。

验收时同时观察错误率、显存不足、服务重启、长请求挤占、温度降频和模型加载时间。满足一次峰值并不等于可以长期运营,生产容量还要保留升级、故障和流量突增空间。

参考资料

  1. NVIDIA显存计算与常见OOM原因https://docs.nvidia.com/nim/large-language-models/latest/troubleshooting/memory.html
  2. vLLM支持的硬件平台https://docs.vllm.ai/en/stable/getting_started/installation/

模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。

配置数字与官方资料有变化?

请通过内容更正页联系我们,并附上对应官方页面。