突发:阿里把 Qwen4 的架构提前开源了!
名字叫 Qwen3.8-Flash-Next, 今天刚放权重。
GDN + QSA 混合注意力、Gated Residual、N-gram Embedding、Muon 优化器——官方自己说这套就是 Qwen4 的前身。
参数账很怪 : 125B 主体 + 51B N-gram 表 , 每个 token 只激活 6B。
官方口径 : 训练成本只有 Qwen3.7-Plus 的 1/9 , 成绩反而全面更高。
SWE-bench Pro 62.5——12 天前刚开源的 27B 是 61.7, 被自家这个 6B 激活量的模型压过去了。
262K 原生上下文,可扩到 1M, 多模态。
API 定价输入 $0.16/1M、输出 $0.47/1M。
我更关心能不能本地跑。
目前的进展:
llama.cpp 支持已经在 PR(#
27739#) , mmproj、MTP 都有,还专门给那张 51B 的表做了 RAM offload——有人拆过 , 表有 3.2 亿行, 但每个 token 只查 16 行, 大头放内存就行,显卡只管 6B 激活。
已经有人算完账 , 判断 4 张 3090 就能跑。
等 GGUF 出来, 我会在 4090 48G 上把它和 27B 对着测一轮
官方发布👇