⚡ 真香!智谱 GLM 大模型背后的那套开源 RL 训练框架开源了——slime
GitHub 揽获 7000+ stars。
做大模型强化学习后训练,最头疼的是一堆 trainer、rollout 服务、agent 框架拼在一起,数据流绕来绕去,出了 bug 还经常是悄无声息的那种。
slime 的思路是把训练、数据生成、奖励计算这些全压到同一条数据流上,用 Megatron 做训练、SGLang 做推理,中间不再叠一层又一层的抽象。
GLM-5.2、GLM-5、GLM-4.6 这一整串智谱旗舰模型的 RL 后训练,背后跑的都是它,等于被前沿模型的完整训练流程反复验证过。
它还支持 Qwen、DeepSeek V3、Llama 3 这些主流模型系列。
GitHub:
顯示更多