资讯
英伟达Rubin Ultra缩水,SemiAnalysis:瓶颈在于每单位带宽成本,而非每单位容量成本
📋总体概括
SemiAnalysis分析称,英伟达将Rubin Ultra的HBM堆叠从12-Hi下调至8-Hi,核心动机不是单纯削减容量成本,而是优化每单位带宽成本。HBM堆叠层数决定容量,带宽取决于堆栈数量、接口宽度与速率,因此减少约三分之一的DRAM裸片用量后,在堆栈和接口配置不变时仍可维持带宽。这反映AI推理时代,持续搬运模型权重和KV Cache对带宽的需求压过了容量堆叠,HBM竞争逻辑正从拼容量转向拼每一美元买到的带宽。
⚡关键信息
- ▸英伟达将Rubin Ultra的HBM从12-Hi下调至8-Hi,可减少约1/3的DRAM裸片用量,缓解HBM供应紧张。
- ▸SemiAnalysis判断缩水主因是每单位带宽成本而非每单位容量成本,堆栈数量与接口不变时带宽可维持甚至提升。
- ▸推理为主的工作负载需持续搬运模型权重和KV Cache,内存带宽的重要性正在超过容量。
- ▸HBM竞争逻辑转变:从单纯堆高容量转向在DRAM、功耗和成本约束下最大化有效带宽。
🔥犀利点评
这则分析点破了一个被容量军备竞赛掩盖的真相:推理时代的显卡不吃存储,吃搬运。英伟达砍掉12-Hi不是抠门,而是算过账——省下的三分之一DRAM裸片,在HBM价格居高不下的当下就是真金白银的利润,而用户几乎感知不到带宽损失。真正该慌的是靠堆层数讲故事的HBM厂商,客户要的指标已经换了赛道。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文 →