Register and share your invite link to earn from video plays and referrals.

AI少年
@aehyok
📖 全栈独立开发者|喜欢编程和爱折腾AI   🚀 AI实战|AI工具评测|AI教程 🧠我的个人武器库: 🛰 vx:aehyok ✉️ 我的公众号: 那个曾经的AI少年
Joined December 2014
433 Following    10.9K Followers
赶在牛来(Ox Alpha)未来之前,Qwen3.8-Flash-Next 重磅提前发布。 看截图,仅三项跑分没有超过 Deepseek v4-flash 或 Claude-Opus 4.6(max)! 1、Qwen3.8-Flash-Next 作为 Qwen4 架构预览版。 2、原生多模态 MoE 3、参数 125B 的主模型,每 Token 仅激活约 6B 4、额外挂载 51B N-gram Embedding,大内存 Mac和DGX Spark 适配度很高。 5、另外首次引入 QSA:稀疏选择长上下文 6、GDN + QSA 混合 Attention 7、4 路 Gated Residual + Muon Optimizer 8、相比 Qwen3.7-Plus,官方称训练成本降至约 1/9 所以我觉得这次最值得关注的并不是 又开放了一个 125B 模型,而是: Qwen 正在把大模型的容量和实际推理计算量彻底拆开。 125B 用来提供容量,6B 负责实际计算,51B N-gram 负责低成本存储局部模式,GDN 负责记,QSA 负责找。
Show more
怕了吗? 代号叫 Paloma,多方爆料指向 Qwen-3.9。 这是对国外大模宣战了吗? 另外 Qwen3.8-Flash-Next 即将开源