註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

沉浸式翻译
@immersivetran
加入 May 2023
0 正在關注    0 粉絲
一台 25GB 内存的普通电脑,跑起了 744B 的 GLM-5.2。 之前我们聊过 GLM-5.2 的 1M 上下文、聊过它对 AI 定价逻辑的冲击。今天聊一个更极端的问题:这个 744B 的庞然大物,最低能在什么样的机器上跑起来? GitHub 上一个叫 colibrì(蜂鸟)的项目给出了答案:约 25GB 内存的消费级机器。不用 GPU,不用 Python,整个引擎是一个约 2400 行的 C 文件,零依赖。 它的思路利用了 MoE 架构的本质: 744B 参数里,每个 token 真正激活的只有约 40B,其中逐 token 变化的路由专家只有约 11GB。于是—— 1️⃣ 稠密部分(注意力、共享专家)int4 量化后约 9.9GB,常驻内存 2️⃣ 21,504 个路由专家(约 370GB)放在硬盘上,按需流式读取 代价是什么?作者在 README 里写得异常坦诚:冷启动每个 token 要从磁盘读约 11GB,速度只有 0.05–0.1 token/秒。翻一句话可能要几分钟。 "This is not fast."——但它证明了一件事:跑通一个 744B 前沿模型,不一定需要机房,一台“比一个 H100 风扇还便宜”的机器就够了。 大模型的门槛,正在被各种意想不到的方式拆掉。 🔗:
顯示更多