显存规划工具
先算模型权重,再决定用几张GPU
输入参数量、精度、GPU数量和每卡预留,得到权重下限与规划显存。结果用于筛选,不代替真实模型压力测试。
计算结果
权重总量约—仅按参数与精度计算
每卡权重约—假设权重均匀切分
每卡规划显存约—包含输入的额外预留与安全余量
模型存储至少—包含权重及约10%文件开销,不含多版本
这个计算器没有计算什么
KV缓存的准确大小取决于模型层数、注意力结构、数据类型、上下文和并发,不能只靠总参数量推出。MoE模型还要按完整权重规划下载、内存和存储,不能只填写激活参数。
怎样使用结果
- 先用结果排除明显装不下的配置。
- 选择具体模型、量化和推理框架。
- 使用目标上下文与并发运行压力测试。
- 记录显存峰值、首字延迟、吞吐与错误。
- 为升级、故障和流量变化保留容量。
计算基础参考NVIDIA公开说明:权重显存约为参数量乘以每参数字节数,再按张量并行GPU数量分摊。查看官方说明