🍲 真香!Soup 能在一张 4GB 显存的笔记本显卡上微调 80 亿参数的大模型,一个 YAML 配置加一条命令就开跑。
今年 2 月才建的仓库,GitHub 上已经 8000 多 star、1200 多个 fork,Apache-2.0 协议,背后那套方法还挂了预印本,Zenodo 的 DOI 是 10.5281/zenodo.21918325。
想微调一个自己的模型,卡在显存上的人太多了:手里是张游戏本的 3050,想碰 Llama-3.1-8B 连加载都加载不进去,只能去租云上的卡,调参调一半还得盯着账单。Soup 的解法是让冻结的基础模型权重待在内存里,训练时按层一层一层喂给 GPU,显存峰值被压到 3.32GB——官方在 RTX 3050 笔记本版上实测 119.6 tokens/s,在 H100 上独立复现是 113 tokens/s,两边的显存峰值一模一样。
整套流程被收成了几条命令:起配置、开训、直接跟训完的模型对话、推回 Hugging Face。SFT、DPO、GRPO、PPO、ORPO 这些后训练方法都在里面,Llama、Qwen、Gemma、Mistral、DeepSeek、Phi-4 这一百多个模型都有现成配置可以抄。
更有意思的是项目自述:这玩意本身就是在一台 4GB 显存的笔记本上开发和维护的。最近一个版本合进去的 60 个改动,全部来自维护者之外的 22 位贡献者。
有一点得说清楚:按层送显存这个功能目前还标着 Beta,上面那组性能数字是在旧版本上测的,作者自己注明了修完一个正确性问题之后还没在 4GB 卡上重测。
显存不够,不再是不能微调的理由了。
GitHub:
顯示更多