两个月前因为供应不足,NV rack DRAM配置削减,现在HBM上又发生了一次:客户要求Nvidia Rubin Ultra GPU 12层堆叠变成8层,造成HBM减配
我的观点很明确,如果真的让这个减配成为主流,那下一代产品token效率还不如上一代,谁还买啊
现在正处于明年HBM合约价谈判拉锯战时期,这个时机就很值得玩味了
这次的客户集体施压做减配版,根本原因可能有几个:
1. 供应确实短缺,12hi -> 8hi确实能让供应量变大
2. 给HBM三家供应商明年的长约价格谈判施压,如果做12hi -> 8hi型号,对三家的股价肯定有压力,属于谈判凭空造牌了,而且是明谋造牌
就算真的做出来了这样的减配版,顶多是某一种sku型号,12 hi的sku型号是不可能放弃的,而且仍然是主力
而8 hi这样的型号用在大模型推理端token效率是不划算的,顶多只能用在compute heavy而对hbm size不那么敏感的地方,比如prefill,不然的话,还不如买上一代产品rubin呢
每一代GPU单位电力的token throughput必须要指数型进步,最好是翻倍,才能大卖
所以rubin ultra在架构没有什么大改动的情况下,决定token throughput的HBM必须要在带宽或者size上指数增长
看看这次市场会不会还是像上次那样,把供应短缺解读成需求减少
顯示更多