HBF不是更便宜的HBM
HBF,是在hbm和ssd之间插入一个新的层。
解决的是hbm不够,和ssd太“慢”的问题
但 HBF 仍然是 NAND Flash,这一点决定了其适合存模型权重存储。
Weights 基本属于 Write Once, Read Many,很少修改。这几乎是 NAND 最理想的 workload。未来数 TB 甚至十几 TB 的模型,可以大量驻留 HBF,HBM 只保存真正需要高速访问的 hot working set。
但KV Cache 会随着 token 生成不断写入,Session 结束后又被释放。NAND 不像 DRAM 可以任意覆盖,它存在 page/block、erase-before-write 和有限 P/E cycle。如果简单把 HBF 当成 DRAM 使用,很容易经常移动、擦除并重写大量数据,最终浪费带宽、增加功耗并缩短寿命。
这也是 HBF 规范开始强调 Weights 与 KV Cache 分 Channel 的原因。两者读写模式和生命周期完全不同,不能再粗暴地混在一个资源池里。
但 KV Cache 未必因此不适合 HBF。它有一个重要特点:很多情况下并不是反复覆盖,而是 Append → Read Many → Bulk Release。如果 Runtime 能进行连续写入、批量回收,再结合 wear leveling、over-provisioning 和 hot/cold KV 分层,耐久性就可能从物理死穴变成工程优化问题。
这也揭示了 HBF 以及各种存储优化的一个新趋势:AI 内存正在从硬件问题变成软硬件协同问题。
未来 GPU 的内存体系可能变成:
SRAM → HBM → HBF → SSD
HBM 保存最热的数据;HBF 保存大量权重和较冷 KV;SSD 保存更冷的数据。Compiler 和 Runtime 自动决定数据放在哪里、何时 Prefetch、何时迁移、何时释放。
因此接下来存储架构设计的核心是,谁能最高效地管理数 TB 甚至数十 TB 的异构 AI 内存。
和历史上所有计算机架构优化的底层原因一样,这是资源不足逼出来的“创新”
当然,这并不能解决存储瓶颈,只能一定程度的缓解,或者说,用相对便宜量大的存储顶一部分昂贵且量小的存储的需求
顯示更多
白线 WhiteLine Daily:HBF 不是用 NAND 替代 HBM,而是把部分模型权重搬到 xPU 旁边。SK 海力士与闪迪已经发布首个开放标准,但距离送样和收入兑现仍有时间。短期更值得关注闪迪财报、NAND 价格和数据中心 SSD 表现,HBF 能否带来新一轮重估,最终还要看订单。
阅读全文:
顯示更多
SK海力士联手闪迪发布全球首个HBF标准规范,谷歌加入生态
最高容量512GB、带宽最高3TB/s,并引入Google和Tenstorrent参与生态建设。
HBF目前主要是针对HBM装不下、SSD又不够快的AI推理数据,未来可能成为GPU旁边的新一层大容量高速存储。
顯示更多
$META 算是即谷歌之后第二家公司支持和共同开发闪迪的HBF标准的大公司。
今天新闻流里最有价值的一条就是 ,SK海力士和闪迪在FMS 2026上发布了全球首个HBF开放技术标准。Google和Tenstorrent也参与技术验证和标准建立。
规格具体如下:存储介质3D NAND Flash,堆叠支持8层和16层两种配置,单颗容量最高512GB,带宽分三个等级覆盖0.4TB/s到3.0TB/s。接xPU的接口选了UCIe,GPU、CPU、各类AI加速器都能接入。联盟成员包括Google和Tenstorrent,Google DeepMind的工程师会在FMS上参加一场关于HBF突破memory wall的panel。
HBF的定位比较清楚,在HBM和SSD之间插入一个新的存储层级。HBM带宽高但容量有限、成本极高。SSD容量大但延迟太高。HBF用NAND的成本结构去逼近HBM的带宽能力,同时容量远超HBM。
为什么这个新闻很重要?因为MoE已经成了frontier model的主流架构,而MoE的参数结构天然适配HBF。
拿Kimi K3举例,2.8T参数,896个专家每次激活16个,单token实际参与计算的参数大概50-104B。剩下占总量95%以上的专家权重,读多写少,稀疏访问,每次推理只用到一小部分。对延迟的容忍度远高于KV cache,但对容量的要求很大。
你今天想跑一个K3,2.8T参数分布在几十张卡上,专家路由的跨卡通信量极大,基本上要上英伟达NVL72这种scale-up系统才能跑。一套NVL72的采购成本是千万美元级别,小团队和一般公司根本不用考虑。
HBF改变的可能还不只是成本,是MoE的部署方式本身。现在跑大MoE模型,专家权重分散在多张卡上,推理时跨卡通信量很大,对NVLink和网络带宽的依赖非常重。HBF通过UCIe直接挂在xPU旁边,每颗最高512GB,相当一部分专家可以变成本地访问,不用走卡间互联。专家并行从大规模跨卡通信问题,部分转化成了本地HBF读取问题。这对部署门槛的影响可能比单纯降成本还大。
存储成本从纯DRAM/HBM变成DRAM+NAND混合,量级差距10倍以上。DRAM只留给KV cache和当前激活的参数,50-100GB可能就够。
MoE的参数量还在膨胀,K2是1T,K3已经2.8T,10T级别的MoE大概率两三年内就会出现。如果推理侧存储还是只能靠DRAM和HBM,成本门槛只会越来越高。HBF提供了让推理成本和参数膨胀脱钩的可能性。
时间线上,SK海力士给的full commercialization目标是2030年前后,但闪迪今年下半年可能已经在日本建pilot line,商用有机会提前到2027年。
顯示更多
针对英伟达(NVIDIA)即将发布的 Feynman(费曼) 架构,整理了关于三种记忆体SRAM,HBM5,HBF在费曼架构中的协作关系。很多人被这种眼花撩乱的记忆体搞懵了,我来给你们缕顺它们。
一、 3D SRAM:纳秒级“热记忆”突触
(计算核心的物理延伸)
核心功能:
消除访存延迟:提供 < 1ns 的响应,存储单周期内的**瞬时激活值(Activations)**与指令碎片。
高速缓冲池:作为 HBM5 与 Tensor Core 之间的桥梁,通过 SoIC(混合键合) 直接堆叠在 GPU 核心上方,确保计算单元零空转。
技术规格:
带宽/容量:片上带宽 > 150 TB/s,单片容量 1.5 GB - 3 GB。
工艺:采用 2nm / 3nm 工艺,由台积电(TSMC)主导 SoIC 堆叠。
厂商格局:海力士与美光聚焦高密度 6T SRAM 单元以优化热功耗;三星则利用 IDM 优势自研定制化 SRAM 晶圆。
二、 HBM5:费曼架构的“温记忆”主干
(存内计算与 3D 键合巅峰)
核心功能:
模型全集载体:存储 全量权重(Weights) 与 活跃 KV 缓存。
存内计算 (PIM):底层 Base Die 由英伟达定制,支持在存储端直接进行向量加法等预处理,释放 GPU 算力。
技术规格:
性能:单芯片带宽 15 - 20 TB/s,单卡容量可达 1 TB。
互联:全面转向 Hybrid Bonding(混合键合),支持 20-24 层 堆叠。
厂商路径:
SK 海力士:依靠 Advanced MR-MUF 向混合键合平滑过渡。
三星:路线最激进,主导 16 层以上全混合键合。
美光:主攻低功耗控制(低 pJ/bit)。
闪迪/西数:通过 CBA 技术 积累提供高速逻辑层 IP。
三、 HBF (High Bandwidth Flash):智能体“冷记忆”仓库
(长上下文存储的终极方案)
核心功能:
ICMS 平台核心:专门存储 非活跃 KV 缓存,解决 AI Agent 数月跨度的对话记忆。
冷热置换:通过 CXL 3.1 协议实现与 HBM5 的数据无损迁徙。
技术规格:
性能:读取速率达 1.6 - 2 TB/s(接近 HBM),容量高达 8 TB - 16 TB。
耐久度:内置硬件磨损均衡引擎,寿命达普通 NAND 的 5 倍。
厂商路径:
闪迪/西数:领军者,将 HBF 控制器直接键合在 BiCS NAND 下方。
SK 海力士:开发 HBF-NAND 堆栈,力求外形尺寸与 HBM 统一。
三星:推出低延迟 Z-NAND 混合体,缩小与 DRAM 的性能鸿沟。
四、 协作关系总结:AI Agent 任务流
在英伟达费曼(Feynman)架构的 AI Agent 任务流中,三者构建了从“神经反射”到“深度思考”的记忆闭环:3D SRAM 以 < 1ns 的延迟在芯片内实时处理瞬时激活值与指令,确保计算核心零停顿;HBM5 作为封装内的动力心脏,通过 \sim 5 TB/s 的带宽承载全量模型权重与活跃 KV 缓存,维持推理逻辑的连贯性;而 HBF 则作为系统级的长期记忆库,利用 8-16 TB 的海量空间存储非活跃上下文,通过 CXL 3.1 协议与 HBM5 实现数据的冷热置换,共同支撑起智能体跨越时空的复杂任务处理能力。
顯示更多