智谱今天终于把“牛来”的底裤掀了。
前几天 OpenRouter / OpenCode 上突然出现一个匿名模型 Ox-Alpha。
不说自己是谁,1M 上下文,图片视频都能看,Coding 和 Agent 能力还异常猛,很快冲成热门模型。
因为 Ox = 牛,中文社区干脆叫它:
牛来。
然后大家开始扒它的 Tokenizer、reasoning 参数、API 行为,越来越多人怀疑:
这货怎么这么像 GLM?
今天答案公布了。
Ox-Alpha = 智谱 GLM-5.3-Flash。
而且直接开源。
它的规格很有意思:
320B-A18B。
总参数 320B,但每个 Token 只激活 18B。
也就是说,智谱这次没有单纯把模型做小,而是想办法让一个 320B MoE 只付出更小的单步推理成本。
再配上:
1M 上下文
128K 最大输出
原生图片/视频理解
稀疏注意力 + 线性注意力
Coding + Tool Use + Agent
Browser / GUI / Computer Use
Office / PPT / Excel / PDF 工作流
尤其有意思的是视觉。
它不是“给模型加双眼”这么简单。
而是:
写代码 → 看自己跑出来的界面 → 找问题 → 修改 → 再看。
视觉直接进入 Agent 的执行闭环。
性能也不像传统 Flash 模型。
Artificial Analysis Intelligence Index 57 分;
DeepSWE v1.1:63.4
GLM-5.2:46.2
AutomationBench:48.8
GLM-5.2:26.2
智谱自己的 Code Bench 最高档甚至做到 29.0 vs Claude Opus 4.8 的 29.5。
然后最离谱的来了:
价格。
官方给出的定位是:
GLM-5.3 的 1/10;
首发优惠只有 1/20;
约 Claude Opus 4.8 的 1/40。
这可能才是 GLM-5.3-Flash 真正可怕的地方。
因为 Agent 时代真正烧钱的不是问一句“北京天气怎么样”。
而是一个 Agent 连续工作几十分钟甚至几个小时,反复:
思考、读文件、写代码、调用工具、看网页、修改、验证……
Token 是按百万、千万往外烧的。
所以未来模型竞争的核心,可能正在从:
“谁最聪明?”
变成:
“谁能把足够聪明的模型,便宜到让 Agent 敢一直跑?”
当然,本地党先别高兴太早。
A18B ≠ 18B 模型。
它依然有 320B 权重。
粗算 INT4 权重也要 160GB 左右,还没算 KV Cache 和运行开销。
所以普通 24GB/48GB 显卡想直接满血跑,目前基本别想。
但权重已经开了,SGLang Day-0 支持也来了。
接下来真正好玩的事情才开始:
320B-A18B 的“牛来”,到底最低什么硬件能把它在本地跑起来?
如果真能本地跑起来,我打算测试一下DeepSeek Harness 生态插件OpenContext
顯示更多
还在把 md 当记忆补丁、把窗口加大当「有记忆」的,这篇值得认真拜读一下。
窗口再大也只是缓存。Harness 调的再顺,也只是外壳在进化,模型没进化。RAG 再全,也只是把查询相关的信息塞回到 prompt。官方这篇写得很硬核:这些做法给了 AI 更多的信息,但却不能让 agent 变的更强。
从初级助理变成熟手搭档的,是需要带着判断和反馈的工作经验——而这种东西网上是没有的。
两派人现在走的不是一条路。一边继续往外加检索、加会话摘要、加更长的上下文;而另一边则是把真实工作流里的判断、改稿、交付结果,经过筛选写回权重,再用质量门和回滚把进化锁住。前者每次接活都有点重来的味道,后者每干完一次,下一次再干就又有了很大的进步。
Alloomi 把应用层和模型层焊在一起,四层是一个飞轮,不是四个功能。OpenContext 开源的是第一层:时间上下文、记忆检索、上下文校正、多平台接入、主动调度。产品侧是 OKR 驱动的自进化数字员工,已经在法律、保险、投顾这些高专业度场景里共创。
下一阶段比的不是模型有多聪明,是它在真实世界里每干完一件活,学走了什么。
现在智能只是起跑线,而经验和判断力才是分叉口。你站哪边?👇
顯示更多