TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Fiona ❤️& ✌️
@nft_hu
TG channel:
参加 May 2018
777
フォロー中
48.8K
ファン
Fiona ❤️& ✌️
@nft_hu
2026.06.23 01:39
那CMX怎么打破内存墙? 困境是对于长上下文和多 Agent 工作负载而言,每个会话的 KV cache很容易达到数十甚至数百 GB。HBM 容量不够;主机 DRAM 又受限于 GPU‑CPU 之间的带宽;本地 SSD 虽然有足够容量,但被困在单节点里,pod 里的其他 GPU 看不到;网络存储可以共享,却对 decode 流量来说慢得多。 如何打破?(如图展示) 「上下文」从 GPU HBM 扩展到由 DPU+以太网+分布式 NVMe 组成的外部 KV 存储层,通过专用数据通路和软件栈,把原本被 HBM 容量卡死的 KV 缓存搬到外部,同时尽量不牺牲延迟,从而绕过 GPU 内存墙。 展开说说便是: GPU 节点上的 Host 侧 BlueField‑4 把这套存储虚拟成一个本地 NVMe 设备,但真正的数据放在另一端的节点上,那边有自己的 BlueField‑4 和 SSD 池。当 GPU 发起读取请求时,Host 侧 BF‑4 把它转换成 RDMA 请求,通过网络交换结构发送过去;Endpoint 侧 BF‑4 收到请求后,从本地 NVMe SSD 读取数据,再把数据回传。最终数据通过 PCIe P2P(peer‑to‑peer)直接写入 GPU 的 HBM,整个过程中主机 CPU 和 DRAM 完全不参与、也看不到这次传输。 硬件实现路径: 1️⃣Rubin GPU 系统:下一代 NVIDIA GPU 负责纯算力,把 KV 管理负担尽可能卸载出去。 2️⃣BlueField‑4 DPU:部署在由 VAST 等存储厂商管理的存储集群上,负责 KV 元数据、数据迁移和协议卸载,让 GPU 不必自己处理这些 I/O 管理工作。 3️⃣Spectrum‑X 交换机 + RoCE:用基于 RoCE 的高带宽低延迟以太网,把 GPU 节点和存储节点连成一个大 KV 缓存池,访问路径从「GPU→HBM」扩展成「GPU→网络→DPU→NVMe」。
もっと見る
0
0
13
33
5
コミュニティへ転送
人気のあるユーザー
New York Post
@nypost
4.1M ファン
オリコンニュース
@oricon
1.9M ファン
Reuters
@Reuters
26.3M ファン
billboard
@billboard
16.5M ファン
一劍浣春秋
@chee828
230.5K ファン
Hello! Project Link
@UpFrontLink
15.5K ファン
ATEEZ(에이티즈)
@ATEEZofficial
4.8M ファン
BTS JAPAN OFFICIAL
@BTS_jp_official
13.7M ファン
BOYNEXTDOOR
@BOYNEXTDOOR_KOZ
870.1K ファン
BABYMONSTER
@YGBABYMONSTER_
956K ファン
BTS_official
@bts_bighit
45.3M ファン
TVer新着
@TVer_info
99.4K ファン
BLACKPINKOFFICIAL
@BLACKPINK
11.6M ファン
cv usk
@cv_usk
220 ファン
Forbes
@Forbes
20.3M ファン