註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

阿蔺A-Lin
@alin_zone
🚀 AI Spark 联合创始人|AI培训 + 企业咨询 📖 新手教程、AI 前沿资讯、工具产品使用推荐 💻 网站: 🛰 vx:a-lin-zone ✉️ 公众号:阿蔺 A-Lin
加入 July 2023
481 正在關注    9.4K 粉絲
Jev 居然输给了一个 1.88B 本地模型?我用俄罗斯方块重新测了一遍 当我看到 this-that-model-1.0 在 68 道决策题上做到 94.1% 准确率,而 Jev 是 76.5% 时,我的第一反应是: 这是真的假的? 一个只有 1.88B 参数、可以在 Mac 本地运行的小模型,真的能在决策任务上超过 Jev 吗? 所以我做了一个俄罗斯方块,让两个模型使用相同的棋盘规则、随机种子和方块顺序。程序负责计算所有合法落点,模型只负责决定方块应该放在哪里。 1️⃣ 一开始,Jev 的表现更好 最初,我先过滤掉明显更差的落点,再把剩下的多个候选位置同时交给模型。 在这一模式下,Jev 的表现更加稳定。 我观察到的一轮里: Jev 消除了 5 行,this-that 消除了 3 行。 如果只看到这里,很容易得出结论:本地小模型还是不如 Jev。 但我后来意识到,这种问题可能并不是 this-that 最擅长的形式。 2️⃣ 换成“二选一”后,结果反了 this-that 本质上是一个 typed decision model,更擅长候选明确、边界清楚的选择题。 所以我把决策方式改成了淘汰赛: A 和 B,哪个落点更好? 胜者进入下一轮,继续和其他候选位置比较,直到选出最终落点。 换成这种模式后,我观察到的一轮结果变成了: this-that 消除了 7 行,Jev 只消除了 1 行。 this-that 的棋盘也更加平整,留下的空洞更少。 模型没有变,游戏没有变。 唯一改变的,是我向模型提问的方式。 3️⃣ 这个模型特别在哪里? this-that-model-1.0 只有约 18.8 亿参数,采用 MIT License,可以下载到本地运行。 它不写小作文,也不慢慢生成 Token。 你给它当前状态、一个问题和几个合法选项,它通过一次前向计算直接返回: 选择哪个 + 每个选项的概率 因此它很适合任务分流、Skill 选择、队列判断、风险分级,以及 Agent 下一步动作这类高频决策。 官方模型卡公布的 68 道决策题中,this-that 答对 64 道,准确率 94.1%;Jev 答对 52 道,准确率 76.5%。 在概率校准指标上,this-that 的 Brier Score 是 0.042,Jev 是 0.133。数值越低,代表模型给出的概率与实际结果越接近。 4️⃣ 但这不代表 Jev 被全面打败了 俄罗斯方块是一条连续决策链,前面一个方块放错位置,后面的棋盘状态就会完全不同。单局结果不能代表模型的完整能力。 而且二选一虽然降低了每次判断的难度,却需要进行更多次模型调用,总延迟不一定更低。 所以更准确的结论不是“this-that 全面强于 Jev”,而是: Jev 更适合某些信息丰富的综合比较;this-that 更适合高频、明确、封闭选项的结构化判断。 这次实验真正让我感兴趣的是: 未来的 Agent 可能不应该所有事情都找最强模型。 高频、重复、答案明确的小判断,可以交给本地小模型;真正复杂的推理与生成任务,再交给 GPT、Claude 等大模型。 有时候,决定结果的不只是模型大小。 还包括:你有没有把问题问成它擅长回答的样子。 因为这个模型够小,其实普通电脑也可以部署,大家有需要的可以看下这个开源模型的介绍,链接我放评论区了👇🏻
顯示更多
0
12
19
1
轉發到社區