DeepSeek冲向10万亿参数?华为CANN社区披露超大规模MoE训练方案

🤖 由 文心大模型 生成的文章摘要

近日,华为CANN社区公开了一份题为《基于昇腾950超节点的万亿MoE模型预训练系统参考实践》的技术文档,其中首次明确提及DeepSeek在预训练支持方面已触及10万亿(10T)参数规模的外推部署权衡。这是目前公开的DeepSeek相关训练技术材料中,模型规模明确达到10万亿参数量级的一次披露。

文档显示,该方案基于PyTorch原生训练框架和昇腾950超节点,结合DeepSeek-V4-Flash的训练验证,系统分析了550B(5500亿)、1.6T(1.6万亿)模型的切分策略,并进一步披露了向10T(10万亿)规模外推时的部署权衡。这为超大规模MoE(混合专家)模型的训练提供了系统性参考。

针对超大规模MoE模型训练,CANN在昇腾950超节点内部及节点之间设计了FSDP(完全分片数据并行)、EP(专家并行)、CP(上下文并行)等多种并行部署策略,并针对模型规模扩大后出现的显存、通信和计算效率问题进行优化。

除模型规模扩展外,该方案还覆盖超长序列、多模态、高可用训练等场景,并针对训练过程中的参数、梯度、优化器状态和激活值进行内存优化。同时,CANN引入了FlexMuon分布式优化器以及大容量记忆表分布式训练等方案,以提升超大规模训练的效率与稳定性。

此次披露意味着DeepSeek在超大规模MoE模型训练方面已具备向10万亿参数级别扩展的技术储备,而华为昇腾950超节点及其CANN软件栈正在成为支撑此类极端规模训练的重要基础设施。随着模型参数从千亿级向万亿级乃至十万亿级迈进,训练系统的并行策略、通信效率和内存管理将成为决定成败的关键因素。