註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

fin
@fi56622380
立场不重要,事物的运行逻辑和内在规律才是更值得关注的部分 | 读过三个不同专业的学位,体验过两个大洲的尘世生活,设计过一次火星车芯片,还没有去看过心心念念的冰川
加入 March 2022
525 正在關注    77.7K 粉絲
两个月前因为供应不足,NV rack DRAM配置削减,现在HBM上又发生了一次:客户要求Nvidia Rubin Ultra GPU 12层堆叠变成8层,造成HBM减配 我的观点很明确,如果真的让这个减配成为主流,那下一代产品token效率还不如上一代,谁还买啊 现在正处于明年HBM合约价谈判拉锯战时期,这个时机就很值得玩味了 这次的客户集体施压做减配版,根本原因可能有几个: 1. 供应确实短缺,12hi -> 8hi确实能让供应量变大 2. 给HBM三家供应商明年的长约价格谈判施压,如果做12hi -> 8hi型号,对三家的股价肯定有压力,属于谈判凭空造牌了,而且是明谋造牌 就算真的做出来了这样的减配版,顶多是某一种sku型号,12 hi的sku型号是不可能放弃的,而且仍然是主力 而8 hi这样的型号用在大模型推理端token效率是不划算的,顶多只能用在compute heavy而对hbm size不那么敏感的地方,比如prefill,不然的话,还不如买上一代产品rubin呢 每一代GPU单位电力的token throughput必须要指数型进步,最好是翻倍,才能大卖 所以rubin ultra在架构没有什么大改动的情况下,决定token throughput的HBM必须要在带宽或者size上指数增长 看看这次市场会不会还是像上次那样,把供应短缺解读成需求减少
顯示更多
0
18
175
22
轉發到社區