Qwen3.8-Flash-Next 开源了,Qwen4 的架构预览被扔出来了。
现在很多模型,底座没怎么变,做一层后训练之后,Agent 能力能突然往上窜一大截。
那问题来了:
后训练到底训练进去了什么?
是知识更多了?推理更强了?还是模型“干活的方式”变了?
我正好部署了两个特别适合做 A/B Test 的模型:
🔥Apodex-1.1-mini-GPTQ-Int4
vs
它自己的底座 Qwen3.5-35B-A3B-GPTQ-Int4
但做完后训练以后,Apodex 自己公布的 benchmark 已经吹得挺狠了:
在 FrontierFinance 上,Apodex-1.1-mini + Agent Team 拿到 50.2。
同一个 benchmark 里,Claude Fable 5 的参考成绩是 49.2。
一个 35B 的开源模型,后训练一下,号称专业 Agent 能力已经能摸到甚至超过 Fable。
这个我偏不信。
我正好有机器。我有两张 4090。
一张跑 Apodex,一张跑原版 Qwen。
同架构、同 INT4、同 128K 上下文、同一套 Agent Harness,两边同时接完全一样的任务。
所以这个实验非常干净:
底座基本没变,主要看的就是后训练到底给 Agent 加了什么能力。
结果越来越有意思。
甚至测出来一层能力,已经开始往 Fable 那个方向靠了。
🔥我给这两个模型和 Fable 出了一道预测题。
2026 年 8 月 26 日,NVIDIA 当天盘后要发 FY2027 Q2 财报。
我提前几个小时,让它们预测:
总营收
GAAP 毛利率
Data Center 营收
下一季度指引
要求自己上网调研,最后给判断。
本来我只是想看看:同一个底座,做过后训练以后,Research + Agent 能力到底能提升多少。
🔥结果这道题出了个非常离谱的乌龙。
底座其实非常努力。它搜了 40 次。
而且最离谱的是:它中间已经把正确答案全部查出来了。
然后到了最终答案——它自己把这些正确数据全扔了。
我一开始都看懵了。
后来翻完整 Agent 日志,才发现真正有意思的事情:
当外部证据和模型脑子里的旧认知发生冲突时,它到底信谁。
🔥这时候你就能明显感觉到,后训练之后的模型,跟底座已经不是一个“工作状态”了。
它看起来会更聪明、更机灵。
它更像一个被教过怎么干活的人。知道什么时候该搜。知道哪些证据更重要。
以后每个企业,都会有一个自己的模型。
不一定是从零预训练。
但至少会有自己的后训练、自己的 Agent 行为、自己的工作习惯。
🔥小模型不一定非得和 Frontier Model 拼所有能力。
把一个方向训透,再配上一套好的 Harness 和 Tool Use,它真的可以变得非常机灵、非常能干。
最后夸一下 Apodex。
这次不只是模型后训练做得好,他们那套 Harness + Tool Use 也确实很能打。
一个 35B 模型被他们训完,再塞进这套 Harness 里,真的已经开始有点专业工种的味道了。
显示更多