註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
加入 November 2020
625 正在關注    12.3K 粉絲
Agent 连续工作几个小时,真正难的是中途失败后,还能准确知道自己做到哪了。 阿里高德团队开源的 LongHorizon-Harness,专门解决长时任务中的状态漂移和错误累积。 它把执行过程拆成 Manage–Execute–Audit 循环: Manager 根据已经验证的进度安排下一步;Executor 在全新上下文中操作桌面、浏览器或命令行;Auditor 再独立检查真实环境。 只有审计确认的结果,才会进入长期任务状态。遇到操作失败、上下文刷新或交付不完整时,Agent 可以保留已完成的部分,从缺口继续推进。 它也不绑定具体模型和后端,可以接入 Claude、GPT、Qwen,以及 Claude Code、Codex CLI、OpenClaw 等工具。 在相同的 Qwen 3.7-Plus 与 Claude Code 配置下,GUI 与 CLI 混合任务通过率从 51.8% 提升到 80.7%;OSWorld 完整完成率从 2.8% 提升到 8.3%;Terminal-Bench 成功率从 69.7% 提升到 77.2%,同时减少了 24% 的 token。 我觉得这篇最有意思的地方在于,它把长时能力的重点,从让一个会话持续运行,推进到了让每段进度都可验证、可恢复,也能可靠地交给下一轮。 模型决定单步能力,harness 决定这些步骤最后能不能拼成一个完整交付。 📎 arxiv:
顯示更多