【从2022年95%对3%的绝对垄断,到如今50%对8%的攻守易位,华为昇腾用四年时间在中国AI芯片市场完成了一场几乎不可能的逆转——而这场逆转的关键,并不在于单颗芯片有多强。】
【不是芯片的胜利,是架构的胜利】
【华为轮值董事长徐直军日前确认,昇腾系列AI芯片在中国市场的份额已经超越英伟达。第三方机构统计与华为全连接大会公布的数据相互印证:昇腾拿下约50%的份额,英伟达则萎缩至8%。这个数字放在四年前几乎是不可想象的——2022年,英伟达在中国AI加速卡市场独占95%,昇腾只有3%。】
【值得玩味的是,徐直军本人并不回避短板。他坦言,若只看单颗芯片,华为的瓶颈非常明确:可用先进制程节点受限。换句话说,在同等工艺条件下比拼单芯片算力,华为并没有必胜把握。但华为选择了一条完全不同的路——不跟对手比”谁的单颗芯片更强”,而是比”谁能把更多芯片高效连起来”。这个思路的转向,才是这次份额反超的真正底层逻辑。】
【Peerium架构:把百万颗芯片拧成一台计算机】
【华为给出的答案是Peerium计算架构与UnifiedBus(灵衢总线)技术。这套方案的核心突破在于”对等互连”——它可以支持多达一百万个处理器以对等方式协同工作,彻底打破传统主从架构中主控节点成为瓶颈的宿命。对于动辄需要数万张卡并行训练的大模型来说,这种架构带来的直接收益就是模型浮点运算利用率(MFU)的显著提升。】
【一个具体的落地案例是Atlas 950 SuperPoD超级节点,华为正在部署测试的规模达到25.6万张计算卡。海思首席科学家廖恒博士解释,这个数字并非拍脑袋决定,而是为了支撑未来两年中国6至7家前沿AI实验室训练10万亿至40万亿参数规模的基础大模型,同时也要考虑数据中心电网与电力输送的实际承载力。这说明华为的超节点设计已经从”堆算力”进入”算力、电力、网络协同设计”的工程化阶段。】
【CUDA的墙,正在被算法本身拆掉】
【比硬件更难跨越的是软件生态。廖恒坦承,两年前昇腾最大的障碍就是PyTorch与CUDA构筑的软件壁垒,开发者迁移成本高得令人望而生畏。但最近18个月出现了一个微妙的变化:模型数学与程序设计复杂度持续提升,新的编译器语言不断涌现,前沿实验室对CUDA的依赖正在松动。】
【这背后其实是一个行业规律:当上层算法迭代速度超过底层工具链的适配速度时,封闭生态的护城河反而会成为拖累。对华为而言,这不是靠一己之力推倒CUDA的墙,而是等算法演进自己把墙推松。当然也该清醒看到,50%的中国份额是在特定外部环境下的结果,全球市场与高端制程的差距依然客观存在。真正的考验不在于份额数字,而在于这套超节点架构能否在下一代模型训练中持续证明自己的性价比。】
— END —
萌头条编辑部原创发布 · 转载请注明出处
