Jev 最近火起来以后,我看到一个挺有意思的问题,它到底是一种新范式,还是把大模型隐藏的一部分能力单独拿出来了?
Arcturus Labs 最近写了一篇很有意思的分析。
Jev 最核心的特点,是不让模型生成一大段解释,而是直接输出结构化判断和概率。
模型路由、工具选择、安全判断,这些高频决策其实都可以转成分类问题。
作者有个判断我挺认同。大模型其实早就在做类似的事情。
Tool Calling 其实就是模型在判断下一步该调用什么、什么时候调用,以及怎么执行。
如果未来这种能力直接融合进模型内部,Agent 可能会多一个更强的决策层。它可以实时判断要不要切更大的模型、是否继续推理、哪些步骤值得执行,减少很多无效成本。
当然,Jev 最大的问题也很现实。
如果它的优势主要来自训练方法、合成数据和校准能力,这些可能会形成护城河。反过来,如果只是把大模型已有能力重新产品化,大厂也可能很快跟进。
我觉得这也是 Jev 现在最值得讨论的地方。
很多新方向的竞争,最后拼的可能并不是谁先发现这个能力,而是谁能把它做成稳定、低成本、可规模化的基础设施。
文章
显示更多
jev可以根据用户活跃时间快速判断用户是否来自中国,帮助claude进行封禁
Jev 真有那么强么?你真的看懂 Jev 了么?
最近全网都在讨论 Jev,我发现有些朋友可能被一些无脑营销号给带跑偏了。
首先,Jev 其实没有提供一种现在其他大语言模型完全不具备的新能力。
它现在主打的这些分类、打分、概率判断、结构化输出等功能,市面上其他的大语言模型,比如 GPT、Claude、Grok、DeepSeek、GLM,甚至豆包,其实都可以做到。
Jev 的优势,是在输出这些结构化结果的时候,可以做到更快、更便宜、更稳定。
它针对的就是这一类特定任务,直接输出结构化结果和概率,不需要像普通大语言模型一样生成一大段自然语言。
第二点,也是我觉得现在大家讨论得比较少的:
这个东西的判断能力,到底是什么水平?
因为它再快、再省 Token,最后干的事情也还是:
我们给它输入一堆上下文,让它去判断一个事情,最后给你一个选择、一个分数,或者一个概率。
但问题来了,它吐给你一个 90% 的概率,我们凭什么认为这个 90% 就是对的?
比如 Jev 告诉你:
这段代码有安全风险,概率 92%。
这个用户有购买意愿,概率 87%。
这个 Agent 下一步应该调用搜索工具,概率 95%。
那这些数字的到底准不准呢?怎么衡量?
所以这里最终还是绕不开一个问题:
这个模型它的“脑子”到底怎么样?智力如何?
目前官方给出的说法,是在 System One 这一类任务上,Jev 的能力平均比较接近 GPT-5.6 Terra 默认推理强度的水平。
因为抛开模型的判断能力,只讨论“快”和“便宜”,意义其实没那么大。
现在本地随便跑一个小参数模型,也可以做到很快,成本接近于零。
但如果如果它回答结果的准确度很低,那再快有什么用?
所以我们讨论 Jev,不能只看价格、速度,还要看对各种任务的准确度。
如果有人无脑吹 Jev,说它强到可以解决其他大模型解决不了的问题,要不就是说了一堆牛逼的效果但其实根本没法用于生产,那这种内容基本就不用看了,八成是为了噱头自己胡编的。
我觉得 Jev 真正值得关注的,是它背后的这套思路:
专门针对 Agent Harness,做一个负责快速判断和结构化输出的专用模型。
相当于把大模型原本已经具备的一部分“快速判断能力”单独抽出来,专门优化成本、速度和稳定性,然后交给 Harness 去调用。
这才是 Jev 真正有价值的地方。
显示更多
Jev现已向所有人开放。无等待列表。
这里:
而且所有用户初始拥有5美元的信用额度(约1.2亿个token)。
趁着现在赶紧玩,如果不赶紧学会,
那时候,你就不用学了。。马上集成!
显示更多
Jev 使用指南:
只做判断、不写字的 AI 模型怎么用、用在哪
Jev 这东西看完,我第一反应是:怎么感觉 AI 绕了一大圈,又回到最早 NLP 那套了。
情感分析、意图识别、分类、打分、路由,本质还是做判断。
区别是以前一个任务训一个模型,现在底层有了 Foundation Model,直接把复杂语义理解拿来做一个更通用的 AI 判断器。
某种程度上,AI 开始从万能大模型重新走向专业化分工了。
显示更多
Jev 模型上手不知道干嘛?看官方的五个案例🔥
1、模型路由
简单的任务用小模型 复杂的任务再用大模型
2、上下文有效检测
判断任务所需上下文有效的在 放入上下文
3、Agent 错误检测
针对输出结果做评判 可以减少 AI 出错
4、终止条件判断
执行长时间操作的时候 可以用结果判断 如果无法再继续执行 会终止任务
5、权限控制
针对一些高危操作 敏感数据做一个简单判断 最近操作的时候就不用开最高权限
其实这 5 个案例本质就是把 JEV 模型当做一个判断分支, 在做事情或者是做操作的时候 都可以优先进行一次判断
不仅可以有效地减少上下文的污染,还可以增加整套任务流程的准确性和效率
我也在探索其他方向 看看效果怎么样
显示更多
jev又是个啥东西?
有没有懂的来科普一下?
感觉X上又要风靡一个新概念了
Jev最适合在实时性强的领域去部署,一个是量化交易,一个是social network互联网社交平台的审核,
还有一个最重要的,就是工业控制自动化领域的大量实时性有一点点强的领域的监控,比如盯着一堆信号和数据仪表盘找出异常转手上报记录。
Jev这种模型肯定是有用,但这些场景比较苛刻,没那么容易找到。
显示更多
Jev 刚发布没几天,开源社区就出现了同款🔥
Decider-2B模型,是基于 Qwen3.5-2B 做了特殊调整
它和 Jev 模型是一样的 只做选择 评分和判断 不是文本类的 LLM 模型
但两者还是有几个明显区别:
1、模型
Jev:闭源 System One Model
Decider:Qwen3.5-2B,约 1.9B 参数,Apache 2.0 开源
2、价格
Jev:$0.042 / 100万输入 Token,输出免费
Decider:本地部署,没有 API Token 费用,只算机器成本
3、速度
Jev:官方约 70–500ms,吞吐 25万 Token/s
Decider:GH200 测试单次约 3–8ms,但硬件环境不同,不能直接横比
4、能力
Jev:重点是 RLCD + 概率校准,产品化更成熟
Decider:同样支持 Choice / Score / Noul,也专门做了 Calibration 训练
5、使用方式
Jev:直接调 API
Decider:自己部署,更适合直接塞进 Pi、Hermes 这类 Agent Harness
如果感兴趣 可以去看一下
模型地址:
显示更多