註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

jsun
@0x7SUN
What The FLock?! | Founder, @flock_io
1.6K 正在關注    5.1K 粉絲
这那那这! 当今最强!
发现了一个跟 Jev 对标的决策模型 来自牛津 AI 团队研发的 this-that-model-1.0模型 背后公司 做去中心化 AI 基建(联邦学习 + 区块链),拿过以太坊基金会学术资助,跟 UNDP、通义千问合作,融了 $11M 开源,而且 API 完全免费 它是一个 typed decision model:你给一段上下文 + n 个选项,它一次前向传播返回选择和校准过的置信度;31ms,零输出 token,格式错误在数学上不可能发生。 跟 Jev 的区别: - Jev 是商业 API,按 token 收费 - this-that-model 在官网API注册使用,input/output/cache 竟然全部免费,注册拿 API key 就能用 - 你还能自己部署,MIT 开源 用法跟 Jev 一模一样,任何「从 n 个选项里选一个」的场景,一次前向传播可以同时回答多个问题 1️⃣ 意图分类 2️⃣ 内容审核 3️⃣ 风险分档 4️⃣ 路由决策 最近Jev又关闭注册了,this-that-model-1.0在官网即可获取免费API 👇
顯示更多
不吹不擂 当今最强
卧槽??一个不到 2B、能本地部署的小模型,给真实 Issue 做分类,跟 JEV 的结果居然这么接近? 最近 JEV 的玩法看了不少,给邮件分类、给 Agent 选工具。这类需求太常见了,我就想知道这张工单该分给谁、下一步该调用哪个工具,真不用每次都给我写一篇分析。 所以这次我把 JEV 和 This That 都接进 Pi,直接拉了 OpenAI Codex 仓库的 30 条真实 Issue,让它们现场做题。 用户是在报 Bug、提功能需求,还是问怎么用?问题出在登录、界面、执行还是会话? 同一份内容、同一组选项,每条做两项判断,两边各发 60 次请求。 跑完一看:JEV 用了 23.5 秒,This That 用了 25.6 秒。30 条里,28 条的两项判断完全一样,两边都没出现请求失败。 速度这轮还是 JEV 快一点。但 This That 只有 18.8 亿参数,权重约 3.76GB,而且能下载到自己机器上跑。这个结果真让我想继续折腾一下了。 它的用法也很干脆:把问题和选项给进去,一次计算直接返回选择和概率。程序拿到结果就能接着往下走,不用再从一大段回答里抠出一个“是”或者“否”。 更实用的是本地部署。客户工单、内部文档、还没发布的产品资料,这些东西只是想分个类,也不一定愿意全部发到外面的 API。 This That 支持 NVIDIA GPU、Apple Silicon 和 CPU,可以把这一步判断留在自己的设备上。做 Agent 的人,手里又多了一个能自己控制的小工具。 这次我跑的是 API 对比,本地性能还没测。28/30 是两个模型判断一致,也不等于准确率,这两个口径先说清楚。 完整录屏放上面。做客服分流、邮件分类、Agent 工具选择的,直接拿一批自己业务里的真实数据试试,比盯着榜单猜有用。 模型和权重: 免费体验地址:
顯示更多
大势所趋 开源是王道
Jev要被开源模型干掉了 ?我来实测两个决策模型的能力,到底有没有吹牛? Jev 实际上不应该跟LLM相比,要测就得找同一个生态位的对手!于是我找到了同样是决策模型的 FLock——一个超轻量级的决策模型,而且完全开源免费 为了不测垃圾数据,我从美国消费者金融保护局(CFPB)公开数据库摘了 1,000 条真实的真人长篇控诉(包含真实口语、愤怒投诉、维权错字以及乱码垃圾单),同时喂给这两个主打毫秒级决策的模型,实时分流到 15 个细分金融业务部门👇 左边:TypeSafe Jev(jev-latest) 右边:FLock(this-that-model-1.0)(开源免费) ─── 具体正确率表现如下 ─── • 日常核心业务 │ Jev: 90%~95% │ FLock: 85%~98% (双方差距不大) • 复杂长文过滤 │ Jev: 70%~100%│ FLock: 14%~61%(Jev占优) • 决策时间对比 │ Jev:33.5 S │ FLock: 36.1S (Jev占优) • API响应速度 │ Jev: 368ms │ FLock: 405ms (双方差距不大) • 官方API 成本 │ Jev: $0.146│ FLock: $0 (Flock成本完胜) ──────────────────────── 客观总结: Jev @typesafeai 在“复杂问题”表现更好: 只要你的业务涉及到多重逻辑交织的复杂长文本、严苛的垃圾噪音拦截、或是误判代价极高的核心环节,Jev 依然是定力最强的选择 FLock @flock_io 免费开源,日常场景性价比无敌: 在占了 80% 以上的高频日常场景里,FLock 准确率稳在 85%~98%,完全够用了,重点的是它仅 2B 参数且开源免费,太厉害了,目前FLock 接API限时免费 同时也可以本地部署 FLock,完全不吃电脑配置:底层仅2 B 参数,一张普通 3060 显卡甚至苹果 MacBook(原生支持 MPS)就能直接拉起来。在消费级显卡上,它的本地推理延迟最低只有 约 31 毫秒...还可以做本地 LoRA 微调...这是JEV没有的优势,太香了🧐@y95277777
顯示更多
欢迎品鉴 甚至我们一天之内更新了v1.1 200%提升 依旧免费开源 deAI for real
Jev 居然输给了一个 1.88B 本地模型?我用俄罗斯方块重新测了一遍 当我看到 this-that-model-1.0 在 68 道决策题上做到 94.1% 准确率,而 Jev 是 76.5% 时,我的第一反应是: 这是真的假的? 一个只有 1.88B 参数、可以在 Mac 本地运行的小模型,真的能在决策任务上超过 Jev 吗? 所以我做了一个俄罗斯方块,让两个模型使用相同的棋盘规则、随机种子和方块顺序。程序负责计算所有合法落点,模型只负责决定方块应该放在哪里。 1️⃣ 一开始,Jev 的表现更好 最初,我先过滤掉明显更差的落点,再把剩下的多个候选位置同时交给模型。 在这一模式下,Jev 的表现更加稳定。 我观察到的一轮里: Jev 消除了 5 行,this-that 消除了 3 行。 如果只看到这里,很容易得出结论:本地小模型还是不如 Jev。 但我后来意识到,这种问题可能并不是 this-that 最擅长的形式。 2️⃣ 换成“二选一”后,结果反了 this-that 本质上是一个 typed decision model,更擅长候选明确、边界清楚的选择题。 所以我把决策方式改成了淘汰赛: A 和 B,哪个落点更好? 胜者进入下一轮,继续和其他候选位置比较,直到选出最终落点。 换成这种模式后,我观察到的一轮结果变成了: this-that 消除了 7 行,Jev 只消除了 1 行。 this-that 的棋盘也更加平整,留下的空洞更少。 模型没有变,游戏没有变。 唯一改变的,是我向模型提问的方式。 3️⃣ 这个模型特别在哪里? this-that-model-1.0 只有约 18.8 亿参数,采用 MIT License,可以下载到本地运行。 它不写小作文,也不慢慢生成 Token。 你给它当前状态、一个问题和几个合法选项,它通过一次前向计算直接返回: 选择哪个 + 每个选项的概率 因此它很适合任务分流、Skill 选择、队列判断、风险分级,以及 Agent 下一步动作这类高频决策。 官方模型卡公布的 68 道决策题中,this-that 答对 64 道,准确率 94.1%;Jev 答对 52 道,准确率 76.5%。 在概率校准指标上,this-that 的 Brier Score 是 0.042,Jev 是 0.133。数值越低,代表模型给出的概率与实际结果越接近。 4️⃣ 但这不代表 Jev 被全面打败了 俄罗斯方块是一条连续决策链,前面一个方块放错位置,后面的棋盘状态就会完全不同。单局结果不能代表模型的完整能力。 而且二选一虽然降低了每次判断的难度,却需要进行更多次模型调用,总延迟不一定更低。 所以更准确的结论不是“this-that 全面强于 Jev”,而是: Jev 更适合某些信息丰富的综合比较;this-that 更适合高频、明确、封闭选项的结构化判断。 这次实验真正让我感兴趣的是: 未来的 Agent 可能不应该所有事情都找最强模型。 高频、重复、答案明确的小判断,可以交给本地小模型;真正复杂的推理与生成任务,再交给 GPT、Claude 等大模型。 有时候,决定结果的不只是模型大小。 还包括:你有没有把问题问成它擅长回答的样子。 因为这个模型够小,其实普通电脑也可以部署,大家有需要的可以看下这个开源模型的介绍,链接我放评论区了👇🏻
顯示更多
AI世界 一天一变 我们昨天用1.0秒杀各家决策模型 今天用1.1版本更新直接挑战大模型的复杂问题 deAI,我们是认真的 没跟您这那那这的~ (附上一条沪语和播客老登梗的海报)
顯示更多
THIS / THAT model 1.1 is already here. Nearly 2x improvement on complex-decision test, ahead of Kimi, GLM & DeepSeek. Same 1.88B parameters. Same ~31ms. Build. Ship. Repeat. trained by FLock
顯示更多
感谢测评F家的“这那模型”!
谁能想到Jev 居然输给了一个 1.88B 本地开源模型🔥 结果真的有点让我意外: 我做了一个贪吃蛇决策游戏 Jev 30:28 险胜,但是换成同一组 68 道决策题,本地模型准确率直接做到 94.1%,Jev 只有 76.5% 一个错了 4 道题,一个错了 16 道题 我本来只是想测试一下 “小模型决策能力怎么?”,结果我抽完发现,小模型虽然小 但是准确率一点也不低。 1️⃣ 先说我是怎么测的 双方使用完全一样的 12×12 棋盘、随机种子、碰撞过滤和路径规划器,只有遇到多个方向都能走的时候,才把选择交给模型。 最后 Jev 吃到 30 个食物,跑满 256 步 本地模型吃到 28 个,在 239 步被困住。 如果单看这一局的成绩,肯定是Jev 赢了。 但是贪吃蛇只是某一步选错以后,后面整条路线都会变,所以我又补了固定的 68 道决策题。 结果 this-that-model-1.0 答对 64/68,94.1%;Jev 是 52/68,76.5%。 Brier Score 也分别是 0.042 vs 0.133,本地模型给出的概率和真实结果更贴近 2️⃣ 这个模型最离谱的地方,是它只有 1.88B this-that-model-1.0 是一个开源的结构化决策模型,MIT License,可以直接在 Mac 本地跑 它和 Jev 的思路其实很像: 不给你写小作文,也不慢慢吐 Token 给它当前状态、一个问题、几个候选答案,它一次前向直接返回: 选哪个 + 每个选项的概率。 所以任务分流、选 Skill、队列选择、标签判断、Agent 下一步动作这种事情,都很适合 我在 M4 上直接用 MPS + FP16 跑,不需要 API Key,也没有网络请求 不同任务中位延迟大概 225~475ms,Snake 实战中位 475ms,平均约 492ms 一个 1.88B 模型,在 Mac 上已经可以做到亚秒级决策。 这个我觉得挺夸张 3️⃣ 我又单独测了 105 道空间决策题 总准确率 84.8%,随机基线只有 34.3% 其中 Snake 状态题、行列文字状态都是 100%,JSON 状态也有 94.4%。 而且输出特别干净。 没有 JSON 少个括号,也不会突然给你解释人生,只会老老实实从候选答案里面选一个,再把概率交给程序 对于 Agent 来说,这种“无聊”反而挺值钱。 4️⃣ 当然它也不是万能的 完整地图测试只有 60.7%,最短路径距离题更是掉到 28.6% 一旦任务需要真正的多步图搜索、连续计算,它就明显不行了 所以这次结果也不能简单理解成: 1.88B 打败 Jev 贪吃蛇单局上是 Jev 赢了,而且 Jev 这次没有保存同条件延迟数据,速度也没法公平比较 真正让我感兴趣的是另一件事: 很多 Agent 里面那些高频、重复、答案明确的小判断,可能根本没必要每次都调用一个大模型,甚至连云端 Jev 都不一定需要。 一个 1.88B、本地运行、一次前向就结束的模型,已经可以完成绝大多数简单的决策了。 一些无关痛痒的简单的决策都可以交给这种小的本地模式、遇到复杂的任务再交给 GPT、Claude这样的大模型可能会更适合。 我现在越来越觉得,未来 Agent 不一定是“所有事情都找最强模型”。 更可能是: 小模型负责做大量的决策,大模型才是真正的为了我们的工作服务。 如果你们感兴趣 也可以部署一下,再偷偷地补充一句 这个可是很牛的牛津团队开源的:
顯示更多