注册并分享邀请链接,可获得视频播放与邀请奖励。

雨哥向前冲
@xiangxiang103
AI Spark联合创始人 |AI培训+企业咨询 独立开发|专注 AI 工具实测|新手教程|最新动态 wx:hanyu1212|网站:
加入 April 2021
1.4K 正在关注    14.7K 粉丝
千问这次公开的 Qwen3.8-Flash-Next,带来了一组很怪的数字。 MoE 主干 125B,每生成一个 token 只激活约 6B,旁边还挂着一张 51B 的 N-gram Embedding 表,再加上约 4B 的 MTP 模块。全部算下来,规模接近 180B。 那张 51B 的表,大量存放双词组和三词组的向量。模型碰到常见短语、代码片段和局部模式时,可以先查表,再把结果送进后面的网络。常见模式因此少花一些计算,这部分参数也比 MoE 专家更容易卸载到内存。 这套设计很可能会进入下一代 Qwen 架构。 过去大家谈大模型,习惯盯着总参数量和激活参数量。Qwen 这次把计算和存储拆得更开。一部分参数负责每一步都要做的推理,另一大部分保存随用随查的局部模式。模型可以装下更多东西,却不用每次都让全部参数参与计算。 当然,激活 6B 不等于只需要 6B 显存。 官方 BF16 权重约 360GB,FP8 也有约 186GB。社区里目前能完整下载的 GGUF 主要还是约 72.5GB 的极限 IQ1_S,大家更关心的 Q3、Q4 仍在路上。权重已经公开,但离普通电脑舒服地跑起来,还有一段距离。 如果下一代 Qwen 延续这条路线,大模型的竞争会多一个值得观察的数字。除了总参数和激活参数,我们还要看有多少知识可以用更便宜的查表方式参与推理。 这也顺手接上了 @alin_zone 这篇关于 Agent 记忆的文章。 千问在模型内部研究怎样用更低的计算代价装下更多模式,Agent 到了模型外部,还要分清哪些信息仍然有效。它可以记住"英文周报",系统也得知道后来的"中文、300 字以内"已经覆盖了前一条。 开源权重:
显示更多