先说结论

介绍DeepSeek官方模型、R1蒸馏版本和大型MoE权重的差异,提供官方获取入口、配置参考、许可证与部署边界。

推荐链接

从正式来源开始

外部仓库可能更新。下载前请重新查看当前模型卡、文件列表和许可证。

配置参考

用于第一轮方案筛选

候选规模部署规划说明
R1蒸馏Qwen 7B7B级Dense24GB级BF16或较小显存量化单机推理验证起点
R1蒸馏Qwen 14B14B级Dense40GB级BF16或16–24GB量化检查真实任务增益
R1蒸馏32B32B级Dense多卡或大显存量化延迟与长输出成本提高
V3/V4完整模型大型MoE专门多卡集群按完整权重而非激活参数规划

表中显存是规划区间,不是兼容保证;上下文、并发、量化格式和推理框架都会改变实际占用。

01

先区分完整模型与蒸馏模型

DeepSeek官方组织同时提供大型MoE模型、推理模型、代码模型和基于Qwen或Llama底座的蒸馏版本。完整模型的总权重可能达到数百GB甚至更高,不能因为每次只激活部分参数就按激活参数估算下载与显存。

R1蒸馏版本是用推理数据继续训练的小型Dense模型,适合有限硬件验证,但它不是在本地运行完整DeepSeek服务的等价替代。页面与采购文件应准确写出完整仓库名称。

02

单机验证可从这些规格开始

  • DeepSeek-R1-Distill-Qwen-7B:适合验证推理问答、数学或代码任务。
  • DeepSeek-R1-Distill-Qwen-14B:需要更多显存,但可比较复杂任务是否值得升级。
  • 7B或14B的4位量化适合显存有限的测试,质量与输出长度必须重新评测。
  • 完整V3、V4或其他大型MoE模型应作为多卡项目单独设计,不套用单卡表格。
03

配置与输出特点

7B级BF16权重通常接近14至16GB,建议用24GB级显存为上下文和运行开销留空间;14B级BF16权重接近28至30GB,更适合40GB级或多卡环境。INT4可以降低权重占用,但长推理会增加输出Token、等待时间和KV缓存压力。

推理模型可能产生更长的中间过程。企业需要限制最大输出、总请求时间和并发,并检查最终答案是否准确,而不是把回答更长理解为推理更好。

04

许可证必须按具体仓库核对

DeepSeek不同系列可能使用MIT许可证或单独模型协议,蒸馏版本还涉及其底座模型的原始许可证。商业使用、衍生模型、再分发和受限用途应以当前仓库中的许可证为准。

下载时保存模型卡与许可证副本。若使用Llama底座的蒸馏版,还需要同时检查对应Llama社区许可证,而不能只看到DeepSeek名称就假定条款一致。

05

适合企业的验证顺序

  • 先用7B蒸馏版建立质量、延迟与安全基线。
  • 确认14B是否在真实难题上带来足够改善。
  • 记录推理长度、错误自信、重复输出和格式遵循。
  • 涉及知识库时单独检查召回、引用和资料权限。
  • 只有业务收益明确时,再评估完整模型的多卡投入。

参考资料

  1. DeepSeek官方模型组织https://huggingface.co/deepseek-ai
  2. DeepSeek R1蒸馏7Bhttps://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
  3. DeepSeek R1蒸馏14Bhttps://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-14B
  4. DeepSeek V3模型卡https://huggingface.co/deepseek-ai/DeepSeek-V3
  5. DeepSeek模型协议示例https://huggingface.co/deepseek-ai/DeepSeek-V3/blob/main/LICENSE-MODEL

模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。

配置数字与官方资料有变化?

请通过内容更正页联系我们,并附上对应官方页面。