一张B200,带着14台Mac训练模型
最近看到 Pluralis Research 做了个挺有意思的实验:他们用分散在四个国家的 14 台 Mac,给一个 8.3B 参数的 MoE 模型做 RL 后训练。其中一台,还是研究员自己天天用的 MacBook。
简单说,这套系统是:
- 14 台分散在巴黎、苏黎世、都柏林和多伦多的 Mac,负责让模型不断做题、搜索论文、生成回答,也就是产生 RL 所需的 rollouts。
- 一张数据中心里的 NVIDIA B200,负责真正的梯度更新。
- 两边不直接连接,只靠一个 Cloudflare R2 对象存储中转模型权重和 rollouts。
- 最后,模型在 PaperSearchQA 上的 held-out pass
@1 从 29% 训到了 63%。
为什么这么分工?因为 agentic RL 里最耗时间的往往不是反向传播,而是生成 rollouts,很多任务能占掉整场训练 90% 以上的时间。而生成 rollouts 要的是大量推理和足够大的内存,不一定非得动用最贵的训练卡。
Mac 的统一内存刚好适合干这个。尤其是 MoE,模型很占内存,但每个 token 只激活一部分专家,计算量没总参数看起来那么吓人。于是 Mac 用 MLX 跑 int8 推理,B200 用 Megatron 跑 bf16 训练。
当然,这还不是“在家用Mac训练大模型”,但很有意思,这跑通了一种很有意思的算力分工:少量昂贵的训练卡负责梯度更新,大量消费级设备负责最耗时间的生成。以后那些白天开会、晚上吃灰的 Mac,说不定真能兼职给模型打工了?