谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥
结果真的有点让我意外:
我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5%
一个错了 4 道题,一个错了 16 道题
我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。
1️⃣ 先说我是怎么测的
双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。
最后 Jev 吃到 30 个食物,跑满 256 步
本地模型吃到 28 个,在 239 步被困住。
如果单看这一局的成绩,肯定是Jev 赢了。
但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。
结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。
Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近
2️⃣ 这个模型最离谱的地方,是它只有 1.88B
this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑
它和 Jev 的思路其实很像:
不给你写小作文,也不慢慢吐 Token
给它当前状态、一个问题、几个候选答案,它一次前向直接返回:
选哪个 + 每个选项的概率。
所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合
我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求
不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms
一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。
这个我觉得挺夸张
3️⃣ 我又单独测了 105 道空间决策题
总准确率 84.8%,随机基线只有 34.3%
其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。
而且输出特别干净。
没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序
对于 Agent 来说,这种“无聊”反而挺值钱。
4️⃣ 当然它也不是万能的
完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6%
一旦任务需要真正的多步图搜索、连续计算,它就明显不行了
所以这次结果也不能简单理解成:
1.88B 打败 Jev
贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较
真正让我感兴趣的是另一件事:
很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。
一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。
一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。
我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。
更可能是:
小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。
如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:
显示更多