显存规划工具

先算模型权重,再决定用几张GPU

输入参数量、精度、GPU数量和每卡预留,得到权重下限与规划显存。结果用于筛选,不代替真实模型压力测试。

B
GB
用于KV缓存、框架和运行开销;长上下文或高并发应增加。

计算结果

权重总量约仅按参数与精度计算
每卡权重约假设权重均匀切分
每卡规划显存约包含输入的额外预留与安全余量
模型存储至少包含权重及约10%文件开销,不含多版本

这个计算器没有计算什么

KV缓存的准确大小取决于模型层数、注意力结构、数据类型、上下文和并发,不能只靠总参数量推出。MoE模型还要按完整权重规划下载、内存和存储,不能只填写激活参数。

怎样使用结果

  1. 先用结果排除明显装不下的配置。
  2. 选择具体模型、量化和推理框架。
  3. 使用目标上下文与并发运行压力测试。
  4. 记录显存峰值、首字延迟、吞吐与错误。
  5. 为升级、故障和流量变化保留容量。

计算基础参考NVIDIA公开说明:权重显存约为参数量乘以每参数字节数,再按张量并行GPU数量分摊。查看官方说明

继续阅读服务器配置完整指南