当小米玄戒O100、苹果M6 Ultra和英伟达RTX 5090把内存带宽同时顶到TB/s量级,AI算力的胜负手已经从计算核心的算力转移到数据搬运的速度上——这场喂饱GPU的战争,正在重塑整个芯片行业的竞争逻辑。
算力过剩,数据堵车:为什么内存带宽成了新瓶颈
大语言模型的推理过程远比想象中更“偏科”。在自回归生成阶段,每输出一个Token,都需要把数千亿参数从头到尾扫一遍。这意味着,GPU的计算单元再快,大多数时间也只是在空转等待数据送达。苹果Mac产品营销总监Laura Metz直白地点破了这层窗户纸:跑AI Agent时,模型必须驻留在统一内存中随时待命,带宽不够,再强的NPU也发挥不出来。
这种“内存受限”的困境在端侧AI场景尤为扎眼。一个7B参数模型以INT4量化后约4GB权重,哪怕每秒只生成20个Token,也需要近100GB/s的带宽来维持基本运转。若要在本地跑Agent级多轮调用、长上下文记忆,带宽需求直接翻倍。正因如此,苹果M6系列才会用170GB/s、307GB/s、1.2TB/s三档配置,精准标出AI硬件从入局到进阶的三个门槛。
三条技术路径,同一个方向:小米苹果英伟达的带宽狂奔
如果说苹果是在统一内存架构上做加法,那小米玄戒O100走的则是一条更为激进的路线——晶圆级垂直堆叠。把DRAM晶圆直接压在NPU头顶,用物理距离的极致压缩换来1.22TB/s的数据吞吐。这种封装思路本质上是在向“存取距离”开刀,数据传输路径越短,等待的时间越少,能效比也越可控。对于端侧芯片而言,这一方案的工程难度远超传统PCB布线,但收益同样惊人。
英伟达则沿用了GPU领域的老打法:把位宽和显存频率同时拉满。RTX 5090以512-bit位宽配上GDDR7显存,硬生生砍向1.8TB/s的带宽高位。三条路径殊途同归,指向同一个结论:在AI算力走向极致的过程中,数据喂给计算核心的速度已经取代核心数量,成为决定真实性能的命门指标。谁能在数据搬运效率上建立起代差级的优势,谁就能在下一轮计算时代的洗牌中占住制高点。
这场围绕带宽的竞赛,表面看是各家芯片设计的拔河,本质上却是AI产业从“算得出”到“算得快”的关键转折。当消费者用舌头投票的那一天到来,决定一台AI设备体验上限的,也许不再是那颗最亮的计算核心,而是藏在其身后的那条数据高速公路修得够不够宽。
— END —
萌头条编辑部原创发布 · 转载请注明出处
