註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

艾略特
@elliotchen100
Raven: the deepthinking self-improving agent harness
加入 December 2023
1K 正在關注    26.3K 粉絲
前天看 DeepSeek-V4-Flash 0731 刚发布,最在意的就是那条脚注:最亮眼的 Code Agent 成绩,跑在尚未发布的 DeepSeek Harness 上。 今天又看到 Cui 老师开始招募开源 Agent Harness 团队参与内测。 进度好快,模型能力正在越来越多地通过 harness 被兑现出来:工具怎么调用,失败后怎么修正,经验怎么留下来,都会直接影响最终成绩。 我们自己也在做 Raven 这个 agent harness,所以这不是旁观者兴趣。产品之外,EverMind 还做了 EvoAgentBench,专门测试 Agent 能不能从过去的 execution traces 中提取可复用的程序性能力,再迁移到新的任务,就是所谓的自进化。 公开版本覆盖 web research、reasoning、software engineering 和 knowledge work,采用 528/267 的 train/test split,在 2 种 agent scaffold 和 3 种 backbone 下评测。 结果也很接地气:人工整理过的能力可以跨模型迁移,但现有自动方法还没有一种能在所有设置中稳定提升。这比只看一次任务的跑分,更接近真实 Agent 系统里的问题。 如果能参与内测,我们希望基于 EvoAgentBench 的协议跑一轮,对比接入 Harness 前后,以及 Agent 使用历史经验前后的变化,看看提升来自哪里,又会在哪些任务上退化。 @tianyi 如果名额还开放,我们愿意把 EvoAgentBench 接进去跑一轮,完整设置和结果都可以公开。
顯示更多
如果你是 Agent Harness 相关开源项目的开发者,希望参加 DeepSeek Harness 的内测,可以回复或私信联系我。请附上 GitHub id 以及开源代表作。
0
70
50
2
轉發到社區