🔥 高德团队刚开源了一个狠东西,能让 Claude Code、Codex 这些 AI 接了活之后,连着干几十个小时不跑偏。
论文挂在 arXiv 上,还上过 Hugging Face 每周论文榜的第一名。
用 AI 干过长活的都懂那种崩溃:你让它把一个东西从头做完,前两个小时挺像样,越往后越离谱,最后甩你一句「已完成」,点开一看一半是空的。它不是不努力,是干着干着把自己一开始要干嘛给忘了。
LongHorizon-Harness 的解法很像一个靠谱的小团队:一个人管进度,只负责想下一步做什么;一个人埋头干这一步,每次都是清清爽爽的脑子上工;还有一个人专门当验收员,不听干活的自己汇报,直接去电脑上翻文件、点界面、看日志、跑测试,对得上才算数,对不上就把证据记下来重做。
所以中途上下文被清空、某一步彻底失败、交出来的东西不合格,它都不会从零重来,只从最后一次验收通过的地方接着往下走。
同一个模型、同一个工具,只是套上这层壳,官方测下来那种要跨软件折腾一两个小时的任务,能做完的从一半左右提到了八成;命令行和写代码那类活儿也稳了一截,而且 token 还比原来少烧 24%。干得更多,花得更少,这个是真少见。
它管的也不只是敲代码。浏览器、表格、文档、设计软件、3D 软件都能上手,一个任务可以从浏览器开始,中间转到命令行处理数据,再回到桌面软件里出成品,最后回终端跑一遍验证。
而且它不挑模型也不挑工具,Claude、GPT、Qwen 都能接,Claude Code、Codex CLI、OpenCode 这些现成的直接就能用,管进度的、干活的、验收的还能各用各的模型。
目前主要在 macOS 上测过,Windows 能跑但官方说还没测透。
以前是你守着 AI 干活,现在是 AI 自己盯着自己干活。
GitHub:
项目团队在这儿
@loopcua