注册并分享邀请链接,可获得视频播放与邀请奖励。

雨哥向前冲
@xiangxiang103
AI Spark联合创始人 |AI培训+企业咨询 独立开发|专注 AI 工具实测|新手教程|最新动态 wx:hanyu1212|网站:
加入 April 2021
1.4K 正在关注    14.7K 粉丝
Qwen3.8-Flash-Next 本地部署有点离谱了。 125B MoE,Unsloth 直接压到了 75GB 内存就能跑。 不是 75GB 显存。 是 RAM / Mac 统一内存。 这意味着什么? 一台大内存 Mac,甚至一台没有独显、只有大内存的机器,理论上都能把这个 125B 模型装进去跑。 而且这次 Qwen3.8-Flash-Next 每个 token 只激活约 6B 参数,Unsloth 甚至声称 CPU RAM / 统一内存可以做到接近 VRAM 的推理速度。( 但我现在最想看的反而不是 Benchmark。 而是一个最土的问题: 到底多少 token/s? 75GB 的 1-bit 确实把“能不能跑”的门槛打下来了,但如果实际只有几 token/s,那叫成功启动;如果大内存 Mac 真能稳定跑到可交互的速度,那事情就完全不一样了。 因为以后本地大模型拼的可能不再只是: 你有几张 5090。 而是: 你有多少内存,以及多大的内存带宽。 你们赶紧借我一台大内存 Mac 实测一下🤣 如果 125B 真能在这种机器上跑到可用速度,二手 Mac 的玩法可能真要变了。
显示更多
Qwen3.8-Flash can now be run locally! 🔥 The 125B MoE model outperforms Claude-Opus-4.6 (Max). Run on 75GB RAM via Unsloth GGUFs. Qwen3.8-Flash-Next enables CPU RAM / unified mem setups to deliver near VRAM speeds. Guide: GGUF:
显示更多