千问这次公开的 Qwen3.8-Flash-Next,带来了一组很怪的数字。
MoE 主干 125B,每生成一个 token 只激活约 6B,旁边还挂着一张 51B 的 N-gram Embedding 表,再加上约 4B 的 MTP 模块。全部算下来,规模接近 180B。
那张 51B 的表,大量存放双词组和三词组的向量。模型碰到常见短语、代码片段和局部模式时,可以先查表,再把结果送进后面的网络。常见模式因此少花一些计算,这部分参数也比 MoE 专家更容易卸载到内存。
这套设计很可能会进入下一代 Qwen 架构。
过去大家谈大模型,习惯盯着总参数量和激活参数量。Qwen 这次把计算和存储拆得更开。一部分参数负责每一步都要做的推理,另一大部分保存随用随查的局部模式。模型可以装下更多东西,却不用每次都让全部参数参与计算。
当然,激活 6B 不等于只需要 6B 显存。
官方 BF16 权重约 360GB,FP8 也有约 186GB。社区里目前能完整下载的 GGUF 主要还是约 72.5GB 的极限 IQ1_S,大家更关心的 Q3、Q4 仍在路上。权重已经公开,但离普通电脑舒服地跑起来,还有一段距离。
如果下一代 Qwen 延续这条路线,大模型的竞争会多一个值得观察的数字。除了总参数和激活参数,我们还要看有多少知识可以用更便宜的查表方式参与推理。
这也顺手接上了
@alin_zone 这篇关于 Agent 记忆的文章。
千问在模型内部研究怎样用更低的计算代价装下更多模式,Agent 到了模型外部,还要分清哪些信息仍然有效。它可以记住"英文周报",系统也得知道后来的"中文、300 字以内"已经覆盖了前一条。
开源权重: