介绍Meta Llama文本和多模态模型的官方获取方式,比较3B、8B、70B及大型MoE规格的部署场景与硬件边界。
推荐链接
从正式来源开始
部分仓库需要先接受许可证与使用政策。
打开官方页面 →官方入口Llama 3.2 3B Instruct资源有限和边缘文本任务的候选。
打开官方页面 →官方入口Llama 3.1 8B Instruct单卡通用文本与知识库应用候选。
打开官方页面 →官方入口Llama 3.3 70B Instruct多卡级模型,采购前先做容量与许可评估。
打开官方页面 →外部仓库可能更新。下载前请重新查看当前模型卡、文件列表和许可证。
配置参考
用于第一轮方案筛选
| 候选 | 模型级别 | 部署规划 | 注意 |
|---|---|---|---|
| Llama 3.2 3B | 小型Dense | 量化后适合边缘或小显存 | 先接受对应许可证 |
| Llama 3.1 8B | 8B级Dense | 24GB级BF16或较小显存量化 | 单卡应用候选 |
| Llama 3.3 70B | 70B级Dense | 80GB级多卡 | 权重之外还需KV缓存 |
| Llama 4 | 大型多模态MoE | 专门多卡集群 | 不能按激活参数估完整权重 |
表中显存是规划区间,不是兼容保证;上下文、并发、量化格式和推理框架都会改变实际占用。
从Meta官方组织申请和下载
Meta在官方Hugging Face组织中提供Llama、Llama Guard和Prompt Guard等模型。访问部分仓库前需要登录、提交信息并接受许可证与可接受使用政策,审批和实际可访问状态以平台页面为准。
社区GGUF或其他量化版本很多,但企业应先确认它对应的官方模型、版本和许可证,再检查转换者身份与文件哈希。
不同规格对应不同场景
- Llama 3.2 3B Instruct:适合资源有限的文本任务、边缘实验和明确的小型工作流。
- Llama 3.1 8B Instruct:适合单卡通用文本、知识库生成和应用验证。
- Llama 3.3 70B Instruct:质量与资源需求显著提高,通常需要多卡。
- Llama 4 Scout与Maverick属于大型多模态MoE路线,不能按17B激活参数估算完整权重。
配置参考
3B或8B的4位量化可以在较小显存或统一内存设备上验证;8B BF16权重约16GB量级,通常需要24GB级显存才能为运行开销留出更合理空间。70B BF16权重约140GB量级,还需要KV缓存与框架开销,应按多张数据中心GPU设计。
大型MoE虽然每次激活部分专家,但服务器仍需存放并加载完整权重。使用消费级显卡拼接时,还要考虑互联带宽、电源、散热和长期稳定性。
许可证与品牌说明
Llama使用Meta发布的社区许可证,不应笼统写成完全等同Apache或MIT。不同代际条款可能不同,企业需要检查商用、再分发、衍生模型、超大规模用户和署名等要求。
本站仅链接官方入口,不代替Meta的授权流程或法律判断。部署记录应保存当时接受的许可证版本、模型仓库与Commit。
什么时候选择Llama
- 现有应用、工具或团队已经围绕Llama生态建立。
- 需要广泛的推理框架、量化和社区工具兼容。
- 英文或多语言任务在企业样本中达到质量要求。
- 团队能够处理访问审批、许可证和版本固定。
- 与Qwen或DeepSeek比较后,真实任务收益足以覆盖迁移成本。
参考资料
- Meta Llama官方组织https://huggingface.co/meta-llama
- Llama官方网站https://www.llama.com/
- Llama 3.2 3B Instructhttps://huggingface.co/meta-llama/Llama-3.2-3B-Instruct
- Llama 3.1 8B Instructhttps://huggingface.co/meta-llama/Llama-3.1-8B-Instruct
- Llama 3.3 70B Instructhttps://huggingface.co/meta-llama/Llama-3.3-70B-Instruct
模型、许可证与软件会更新,执行前请以官方页面的当前说明为准。
请通过内容更正页联系我们,并附上对应官方页面。