Jev 我已经在 Pi Agent 里真正跑起来了🔥
我这次测试的重点不是测试分类,而是看它能不能参与真实的多工具决策:Pi 负责执行工具,Jev 根据当前 State 决定下一步该做什么
我正常跑了Git 修改、测试失败 3 个场景,Jev 都能根据状态动态改变调用路径,失败时还会主动增加 inspect_failure,而不是机械走固定流程。
13 次调用,3/3 跑通,平均延迟约 683ms。
中间第三次调用出现了失败,然后又做了进一步的调整,最后还是完成了目标
从这个结果角度来看,我希望把 skill 和 MCP 判断的能力交给其他的低端模型去完成,主模型只要去完成业务相关的内容,像工具使用或者结果类型判断,交给一些专门模型处理
顯示更多