登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

Calman.eth卡门 🦇🔊🎶
@CalmanBTC
🚀Do the next right thing. 🎶Co-founder @My3amclub.
参加 August 2021
5.6K フォロー中    65.8K ファン
每天跟着各位老师们学习,很开心啊。 跟着Fiona老师分享的CMX相关的学习,配合老马的@grok 真的是很过瘾的。 这作图能力真的很好,但是不要生成中文的,中文有乱码。 上次听168访谈,除了海量的美股相关的信息和ai集群的一些知识点,Fiona @nft_hu 老师有一个特别有意思的金句,大概意思是: 我曾经是非常好的左侧选手,但是在b圈根本就不敢玩,因为很容易成为被割的对象。但是在美股,就可以大胆的往左侧了。 这句话是真的很真实,美股( A股应该也是)是一个相对公平的市场了大胆投研努力学习,再加上不要频繁骚操作,基本上都不会吃亏的。 继续跟着老师们努力学习! @elonmusk @168MrZ
もっと見る
那CMX怎么打破内存墙? 困境是对于长上下文和多 Agent 工作负载而言,每个会话的 KV cache很容易达到数十甚至数百 GB。HBM 容量不够;主机 DRAM 又受限于 GPU‑CPU 之间的带宽;本地 SSD 虽然有足够容量,但被困在单节点里,pod 里的其他 GPU 看不到;网络存储可以共享,却对 decode 流量来说慢得多。 如何打破?(如图展示) 「上下文」从 GPU HBM 扩展到由 DPU+以太网+分布式 NVMe 组成的外部 KV 存储层,通过专用数据通路和软件栈,把原本被 HBM 容量卡死的 KV 缓存搬到外部,同时尽量不牺牲延迟,从而绕过 GPU 内存墙。 展开说说便是: GPU 节点上的 Host 侧 BlueField‑4 把这套存储虚拟成一个本地 NVMe 设备,但真正的数据放在另一端的节点上,那边有自己的 BlueField‑4 和 SSD 池。当 GPU 发起读取请求时,Host 侧 BF‑4 把它转换成 RDMA 请求,通过网络交换结构发送过去;Endpoint 侧 BF‑4 收到请求后,从本地 NVMe SSD 读取数据,再把数据回传。最终数据通过 PCIe P2P(peer‑to‑peer)直接写入 GPU 的 HBM,整个过程中主机 CPU 和 DRAM 完全不参与、也看不到这次传输。 硬件实现路径: 1️⃣Rubin GPU 系统:下一代 NVIDIA GPU 负责纯算力,把 KV 管理负担尽可能卸载出去。 2️⃣BlueField‑4 DPU:部署在由 VAST 等存储厂商管理的存储集群上,负责 KV 元数据、数据迁移和协议卸载,让 GPU 不必自己处理这些 I/O 管理工作。 3️⃣Spectrum‑X 交换机 + RoCE:用基于 RoCE 的高带宽低延迟以太网,把 GPU 节点和存储节点连成一个大 KV 缓存池,访问路径从「GPU→HBM」扩展成「GPU→网络→DPU→NVMe」。
もっと見る