赶在牛来(Ox Alpha)未来之前,Qwen3.8-Flash-Next 重磅提前发布。
看截图,仅三项跑分没有超过 Deepseek v4-flash 或 Claude-Opus 4.6(max)!
1、Qwen3.8-Flash-Next 作为 Qwen4 架构预览版。
2、原生多模态 MoE
3、参数 125B 的主模型,每 Token 仅激活约 6B
4、额外挂载 51B N-gram Embedding,大内存 Mac和DGX Spark 适配度很高。
5、另外首次引入 QSA:稀疏选择长上下文
6、GDN + QSA 混合 Attention
7、4 路 Gated Residual + Muon Optimizer
8、相比 Qwen3.7-Plus,官方称训练成本降至约 1/9
所以我觉得这次最值得关注的并不是 又开放了一个 125B 模型,而是:
Qwen 正在把大模型的容量和实际推理计算量彻底拆开。
125B 用来提供容量,6B 负责实际计算,51B N-gram 负责低成本存储局部模式,GDN 负责记,QSA 负责找。
顯示更多
怕了吗?
代号叫 Paloma,多方爆料指向 Qwen-3.9。
这是对国外大模宣战了吗?
另外 Qwen3.8-Flash-Next 即将开源