註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

huangserva
@servasyy_ai
古早程序员 | AI出海 | 自由职业 机车游侠&机速购&骑享租创始人 15年前 freelance 起步 → 连续创业者 → 亏过1个亿,逆风翻盘中 分享创业,AI,读书,生活,健身 Official X channel of SERVASYY LLC
加入 December 2025
765 正在關注    39.4K 粉絲
Qwen3 到 Qwen4,架构到底改了什么? 一条讲清楚(建议收藏) 昨天 @Alibaba_Qwen 开源的 Qwen3.8-Flash-Next,官方自己定位是 Qwen4 的架构 Preview。对着 Qwen3 看,一共四个变化,每个都在砍一种成本。 一、读长文的方式变了 Qwen3 处理长上下文,四层里三层是"速记员":把读过的内容压成小抄,快,但细节会丢。每四层留一层"翻录音":回头逐字比对原文,准,但越长越贵——100 万字的上下文,每写一个字都要把 100 万条记录重新比一遍。 Qwen4 给翻录音这层加了道粗筛:先把历史记录每 4 条合成 1 张摘要卡,扫卡锁定重点,再展开只精算最重要的 2048 个位置。长文成本从越长越失控,变成基本随长度线性涨。 二、记忆分家了 Qwen3 的所有知识都揉在参数里,推理和背"固定词组"这种死记硬背混在一起,都占显存、都耗算力。 Qwen4 把死记硬背单独拆出来,做成一张 51B 的查询表,放内存条里。要查哪几行由输入的字决定,提前就知道,第 1 层还在算,表项已经从内存搬到位。显存留给要动脑子的参数,背书的部分上书架。多插几根内存条,换 51B 记忆容量。 三、层间通道拓宽了 Qwen3 每一层都往同一个向量里读写信息,像全公司共用一个群聊,第 3 层发的重要消息,被后面 30 层刷没了。 Qwen4 拆成四个频道,每个模块带开关按需读写。模型堆得越深,这条越值——这是在为更深的 Qwen4 铺路。 四、训练手法换了 大矩阵从 AdamW 换成 Muon 优化器,能开更大的 batch 和学习率,训练全程没炸过 loss。同样的算力预算能炼更多尺寸——所以他们敢预告 Qwen4 会有一堆小模型。 四刀对着四种成本:长文的算力、记忆的显存、深度的信息损耗、训练的时间。 效果官方说超 Qwen3.7-Plus 和 DeepSeek-V4-Flash,厂商自报,我还没测。 9 月云栖大会 Qwen4 发布,到时候拿这四条对答案。
顯示更多
突发:阿里把 Qwen4 的架构提前开源了! 名字叫 Qwen3.8-Flash-Next, 今天刚放权重。 GDN + QSA 混合注意力、Gated Residual、N-gram Embedding、Muon 优化器——官方自己说这套就是 Qwen4 的前身。 参数账很怪 : 125B 主体 + 51B N-gram 表 , 每个 token 只激活 6B。 官方口径 : 训练成本只有 Qwen3.7-Plus 的 1/9 , 成绩反而全面更高。 SWE-bench Pro 62.5——12 天前刚开源的 27B 是 61.7, 被自家这个 6B 激活量的模型压过去了。 262K 原生上下文,可扩到 1M, 多模态。 API 定价输入 $0.16/1M、输出 $0.47/1M。 我更关心能不能本地跑。 目前的进展: llama.cpp 支持已经在 PR(#27739#) , mmproj、MTP 都有,还专门给那张 51B 的表做了 RAM offload——有人拆过 , 表有 3.2 亿行, 但每个 token 只查 16 行, 大头放内存就行,显卡只管 6B 激活。 已经有人算完账 , 判断 4 张 3090 就能跑。 等 GGUF 出来, 我会在 4090 48G 上把它和 27B 对着测一轮 官方发布👇
顯示更多
0
15
34
3
轉發到社區