DeepSeek冲向10万亿参数,我翻完华为的技术方案,发现普通人最该关心三件事
10万亿参数是什么概念? DeepSeek-R1的参数量是6710亿,10万亿是它的十五倍。阿里当前旗舰Qwen 3.8-Max约2.4万亿,DeepSeek现役V4-Pro为1.6万亿。也就是说,10万亿这个数字,是国产已发布模型里最大那个的四倍还多。 华为CANN社区10月5日公开了一份技术文档,标题叫《基于昇腾950超节点的万亿MoE模型预训练系统参考实践》。里面在讲DeepSeek预训练支持时,明确提到“分析550B、1.6T模型的切分策略,以及向10T规模外推时的部署权衡”。 这是DeepSeek公开技术材料中,模型规模第一次触及10万亿参数量级。 我花了一个晚上把这份文档翻了一遍。技术细节很多,但普通人真正该关心的,其实是另外三件事。 10T模型能做什么,得先搞懂MoE 很多人看到“10万亿参数”第一反应是:这跟我有什么关系? 要回答这个问题,得先理解一个概念。DeepSeek用的是MoE架构,全称混合专家模型。 打个比方。稠密模型像一个全能选手,什么问题都得自己上,你问它什么它都要调动全部脑细胞。MoE模型像一个团队,里面有擅长写代码的、擅长翻译的、擅长做数学题的。你问代码问题,只叫代码专家出来,其他人不用动。 总参数是团队总人数,激活参数是每次实际干活的人数。 DeepSeek-V3总参数6710亿,但每次推理只激活约370亿。 DeepSeek V4-Pro的总参数是1.6万亿,激活参数49B。V4-Flash更极端,总参数284B,激活只有13B。 10万亿参数的MoE模型,总参数涨了,但激活参数不一定同比例涨。这意味着它的能力上限大幅提升,但推理成本不会等比例飙升。 所以10T模型能做什么?更强的推理能力、更长的任务链、更复杂的多步骤规划。这些“没见过的新能力”,往往先出现在最大的模型上,再慢慢下放到你手机里那个免费的AI助手。 华为昇腾的方案,到底解决了什么问题 翻完文档,我觉得最有价值的信息藏在“部署权衡”这四个字里。 训练一个10万亿参数的模型,不是把更多芯片堆在一起就能跑起来的。模型大了,显存不够用、芯片之间通信变慢、计算效率下降,这些都是硬骨头。 华为的方案里,有几个关键设计。 一个是FSDP、EP、CP三层并行策略。简单说就是把模型切碎,分布到不同的芯片上去。切法很有讲究,切不好就会出现“有的芯片忙死,有的芯片闲着”的情况。 另一个是FlexMuon分布式优化器,针对参数布局重组、层级流水做了优化。还有GraphTrainer,通过图像映射来编排通信和计算,减少串行等待。 昇腾950超节点以单机柜64张NPU卡为基本单元,最大支持8192张NPU卡高速互联。 这是个什么规模?8192张卡同时跑一个模型,通信延迟控制不好的话,训练效率会大打折扣。 DeepSeek V4已经在这套硬件上跑出了实际数据。V4-Pro在8K输入场景下,单卡Decode吞吐4700TPS,TPOT约20ms。V4-Flash单卡吞吐1600TPS,TPOT约10ms。 这些数字什么水平? 够用。不是最顶尖,但已经能支撑起大规模推理服务。 跟阿里比,DeepSeek的路线有什么不同 阿里在9月云栖大会上宣布,下一代Qwen模型计划扩展到5万亿到10万亿参数。CEO吴泳铭亲自站台,说这是“迈向超级人工智能的关键路径”。 DeepSeek创始人梁文锋在投资者会议上说过一句话,大意是:算力资源撑不住10万亿的训练,即使训出来了,研究所需的算力也远远不够,不如优先做好几千万激活的模型。 这两条路线其实不矛盾。 阿里在推“递归式自我改进”,Qwen3.8-Max已经在无人参与的情况下自主搭建训练流程、构造数据、设计实验,持续迭代超过一个月,完成33轮有效迭代。这条路走的是让AI自己改进自己。 DeepSeek在推“性价比路线”,用更小的激活参数打出旗舰效果,同时通过CANN社区的技术文档展示自己有能力向10T外推。这条路走的是“我有能力做大,但现在不做”。 从产业角度看,字节也在训练10万亿参数模型,据报需要约3万张GPU连续跑三到六个月。三家都在往同一个方向走,只是节奏不同。 训练成本是什么量级,API会涨价吗 聊完技术,说点实际的。 训练一个10万亿参数的MoE模型,需要数万甚至十万级别的AI加速卡,训练周期数月。仅算力硬件投入就是百亿级别。电费、集群运维、芯片采购,每一项都是天文数字。 有人估算,如果用英伟达GB200/GB300构建集群,光硬件成本就可能达到180亿美元。 但这笔钱跟你的API账单关系不大。 MoE架构的特点决定了,10万亿参数的模型不会让每次推理都跑10万亿次计算。真正影响你使用成本的,是激活参数而不是总参数。 DeepSeek在8月已经涨过一轮价了。V4-Pro高峰时段输出价格从6元涨到27元/百万to