千问把 Qwen4"偷跑"了?
新模型叫 Qwen3.8-Flash-Next,但名字是 3.8,底层已经换上下一代 Qwen4 架构。
目前曝光的几个重点:
① 125B MoE,每个 Token 只激活约 6B 参数
② 额外加入约 51B N-gram Embedding
③ GDN 混合层 + Qwen 稀疏注意力
④ 原生多模态,FP8 同步发布
⑤ 约 1/9 训练成本,能力接近 Qwen3.7-Plus,编程和 Agent 表现更强
简单理解:
用 6B 参数负责"现场思考",
用 MoE 专家负责"专业能力",
用 N-gram Embedding 负责"知识记忆"。
不过,A6B 不等于只需 6B 模型的显存。它降低的是计算量,完整权重依然很大,因此更像服务器和 128GB 级设备的模型,而不是 24GB 显卡的本地小钢炮。
所以它真正的定位,可能不是取代 Qwen3.8-27B,而是:
Qwen4 的架构预览版、生态适配版和技术验证版。
真正值得期待的是下一步——如果千问把这套架构做成 27B/30B Dense,那才可能成为本地模型的王炸。
Qwen3.8 还没测完,Qwen4 已经探出头了。
你更期待极速 MoE,还是 Qwen4 Dense?
顯示更多
The next-gen architecture powering Qwen4 is now here! ✨
Get ready for the open release of Qwen3.8-Flash-Next 🚀
The countdown starts now! ⏳🔥