Qwen3.8-Flash-Next 本地部署有点离谱了。
125B MoE,Unsloth 直接压到了 75GB 内存就能跑。
不是 75GB 显存。
是 RAM / Mac 统一内存。
这意味着什么?
一台大内存 Mac,甚至一台没有独显、只有大内存的机器,理论上都能把这个 125B 模型装进去跑。
而且这次 Qwen3.8-Flash-Next 每个 token 只激活约 6B 参数,Unsloth 甚至声称 CPU RAM / 统一内存可以做到接近 VRAM 的推理速度。(
但我现在最想看的反而不是 Benchmark。
而是一个最土的问题:
到底多少 token/s?
75GB 的 1-bit 确实把“能不能跑”的门槛打下来了,但如果实际只有几 token/s,那叫成功启动;如果大内存 Mac 真能稳定跑到可交互的速度,那事情就完全不一样了。
因为以后本地大模型拼的可能不再只是:
你有几张 5090。
而是:
你有多少内存,以及多大的内存带宽。
你们赶紧借我一台大内存 Mac 实测一下🤣
如果 125B 真能在这种机器上跑到可用速度,二手 Mac 的玩法可能真要变了。
顯示更多
Qwen3.8-Flash can now be run locally! 🔥
The 125B MoE model outperforms Claude-Opus-4.6 (Max).
Run on 75GB RAM via Unsloth GGUFs.
Qwen3.8-Flash-Next enables CPU RAM / unified mem setups to deliver near VRAM speeds.
Guide:
GGUF:
顯示更多