가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

Ren
@Ryrenz
🇺🇸 美国全栈程序员 💻 ⚙️ 整理小白能懂的优质 AI 教程 📚 📢 持续挖掘实用的 AI 提效方式 🤖 💰 分享我关于投资、副业、职场的思考 🧠 📝 开源我所有的内容创作与 AI 变现经验 📈
가입 March 2025
673 팔로잉 중    9.3K
🔥 高德团队刚开源了一个狠东西,能让 Claude Code、Codex 这些 AI 接了活之后,连着干几十个小时不跑偏。 论文挂在 arXiv 上,还上过 Hugging Face 每周论文榜的第一名。 用 AI 干过长活的都懂那种崩溃:你让它把一个东西从头做完,前两个小时挺像样,越往后越离谱,最后甩你一句「已完成」,点开一看一半是空的。它不是不努力,是干着干着把自己一开始要干嘛给忘了。 LongHorizon-Harness 的解法很像一个靠谱的小团队:一个人管进度,只负责想下一步做什么;一个人埋头干这一步,每次都是清清爽爽的脑子上工;还有一个人专门当验收员,不听干活的自己汇报,直接去电脑上翻文件、点界面、看日志、跑测试,对得上才算数,对不上就把证据记下来重做。 所以中途上下文被清空、某一步彻底失败、交出来的东西不合格,它都不会从零重来,只从最后一次验收通过的地方接着往下走。 同一个模型、同一个工具,只是套上这层壳,官方测下来那种要跨软件折腾一两个小时的任务,能做完的从一半左右提到了八成;命令行和写代码那类活儿也稳了一截,而且 token 还比原来少烧 24%。干得更多,花得更少,这个是真少见。 它管的也不只是敲代码。浏览器、表格、文档、设计软件、3D 软件都能上手,一个任务可以从浏览器开始,中间转到命令行处理数据,再回到桌面软件里出成品,最后回终端跑一遍验证。 而且它不挑模型也不挑工具,Claude、GPT、Qwen 都能接,Claude Code、Codex CLI、OpenCode 这些现成的直接就能用,管进度的、干活的、验收的还能各用各的模型。 目前主要在 macOS 上测过,Windows 能跑但官方说还没测透。 以前是你守着 AI 干活,现在是 AI 自己盯着自己干活。 GitHub: 项目团队在这儿 @loopcua
더 보기