JEV 的能力边界慢慢开始暴露了
前几天,Browser Use 创始人
@gregpr07 开源的那个爆火 Demo(7 秒订机票、成本 $0.0039)刷爆全网
但后面他亲自用 JEV 跑了一轮长链路任务实测,发现正确率很低,远远落后于GPT luna:
• Luna:17 / 20
• Jev Agent:1 / 20
20 道复杂的现实任务,JEV 整整挂了 19 道……
那它之前为什么能做到 7 秒订机票?它到底强在哪里?
✅这是JEV擅长的:输入需求 ──> 填表 ──> 选航班 ──> 提交成功(毫无分叉,全是直道)
💥这是JEV做不到的:
【真实复杂长任务】
输入需求 ──> 弹窗拦截? ──> 验证码?
↓ ↓
[死胡同] [死胡同]
│ │
JEV:零推理不会回溯,直接原地死锁 💥
Luna+推理模型:回退上一步(Backtrack),切换策略绕行 ✅
客观来说,JEV 确实快到不可思议,但一旦进入真实的复杂环境,逻辑就全崩了:
Browser Use 创始人说: 浏览器交互从来不是简单的元素点击,而是极其复杂的【高维状态空间搜索】
在真实网页里,一个合格的 Agent 必须具备两个核心底层行为:
停下来深思(Think hard)
走不通时原路回退(Go back / Backtrack)
而 JEV 的推理能力(Reasoning)完全为 0。
看来Jev还有很长的路要走啊~~