Jev 居然输给了一个 1.88B 本地模型?我用俄罗斯方块重新测了一遍
当我看到 this-that-model-1.0 在 68 道决策题上做到 94.1% 准确率,而 Jev 是 76.5% 时,我的第一反应是:
这是真的假的?
一个只有 1.88B 参数、可以在 Mac 本地运行的小模型,真的能在决策任务上超过 Jev 吗?
所以我做了一个俄罗斯方块,让两个模型使用相同的棋盘规则、随机种子和方块顺序。程序负责计算所有合法落点,模型只负责决定方块应该放在哪里。
1️⃣ 一开始,Jev 的表现更好
最初,我先过滤掉明显更差的落点,再把剩下的多个候选位置同时交给模型。
在这一模式下,Jev 的表现更加稳定。
我观察到的一轮里:
Jev 消除了 5 行,this-that 消除了 3 行。
如果只看到这里,很容易得出结论:本地小模型还是不如 Jev。
但我后来意识到,这种问题可能并不是 this-that 最擅长的形式。
2️⃣ 换成“二选一”后,结果反了
this-that 本质上是一个 typed decision model,更擅长候选明确、边界清楚的选择题。
所以我把决策方式改成了淘汰赛:
A 和 B,哪个落点更好?
胜者进入下一轮,继续和其他候选位置比较,直到选出最终落点。
换成这种模式后,我观察到的一轮结果变成了:
this-that 消除了 7 行,Jev 只消除了 1 行。
this-that 的棋盘也更加平整,留下的空洞更少。
模型没有变,游戏没有变。
唯一改变的,是我向模型提问的方式。
3️⃣ 这个模型特别在哪里?
this-that-model-1.0 只有约 18.8 亿参数,采用 MIT License,可以下载到本地运行。
它不写小作文,也不慢慢生成 Token。
你给它当前状态、一个问题和几个合法选项,它通过一次前向计算直接返回:
选择哪个 + 每个选项的概率
因此它很适合任务分流、Skill 选择、队列判断、风险分级,以及 Agent 下一步动作这类高频决策。
官方模型卡公布的 68 道决策题中,this-that 答对 64 道,准确率 94.1%;Jev 答对 52 道,准确率 76.5%。
在概率校准指标上,this-that 的 Brier Score 是 0.042,Jev 是 0.133。数值越低,代表模型给出的概率与实际结果越接近。
4️⃣ 但这不代表 Jev 被全面打败了
俄罗斯方块是一条连续决策链,前面一个方块放错位置,后面的棋盘状态就会完全不同。单局结果不能代表模型的完整能力。
而且二选一虽然降低了每次判断的难度,却需要进行更多次模型调用,总延迟不一定更低。
所以更准确的结论不是“this-that 全面强于 Jev”,而是:
Jev 更适合某些信息丰富的综合比较;this-that 更适合高频、明确、封闭选项的结构化判断。
这次实验真正让我感兴趣的是:
未来的 Agent 可能不应该所有事情都找最强模型。
高频、重复、答案明确的小判断,可以交给本地小模型;真正复杂的推理与生成任务,再交给 GPT、Claude 等大模型。
有时候,决定结果的不只是模型大小。
还包括:你有没有把问题问成它擅长回答的样子。
因为这个模型够小,其实普通电脑也可以部署,大家有需要的可以看下这个开源模型的介绍,链接我放评论区了👇🏻
顯示更多