TwiScan
Hot
Communities
Account collections
Login
Register
English
日本語
한국의
简体中文
繁体中文
Register and share your invite link to earn from video plays and referrals.
Register now
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
Joined November 2020
630
Following
12.5K
Followers
Xudong Han
@Xudong07452910
2026.08.06 09:30
一个 9B 模型,专门学习怎么给 Agent 修 harness,最后比更大的前沿模型改得更稳。 这篇论文提出 Harness-R1,把「改进 Agent 的运行外壳」本身训练成了一项能力。 它会读取 Agent 的失败轨迹,找出工具误用、状态丢失、重复尝试和恢复失败等问题,再生成可以直接运行的 harness 补丁。 补丁可以介入任务开始、决策前、执行前和环境反馈后,调整上下文、动作验证和错误恢复。 关键在于,系统不会根据补丁写得是否合理来打分。 修改后的 Agent 必须重新执行任务,真实成功率有没有提升,才决定这次修改值不值得学习。 在 WebShop、ALFWorld 和 DBBench 上,Harness-R1 将 Qwen3.5-9B 的平均成功率从 44.3% 提升到 53.6%。当目标 Agent 自身经过微调后,它还能继续把成功率从 59.2% 推到 64.2%。 训练出的编辑能力也迁移到了 20 个未见过的目标模型,平均提升约 7 个百分 现在模型可以从经验中更新参数,Harness Engineer 则学习如何调整上下文、工具、验证和恢复机制。 看起来合理的修改,放进真实系统后可能反而降低成功率。未来 Agent 改进 Agent,真正重要的标准还是能不能跑通、能不能验证,以及出问题后能不能回滚。 📎 arxiv:
Show more
0
0
45
149
39
Forward to community
Most Popular Users
Tibo
@thsottiaux
777.9K Followers
Serenity
@aleabitoreddit
1.1M Followers
Donald J. Trump
@realDonaldTrump
111.9M Followers
Elon Musk
@elonmusk
241.7M Followers
Sam Altman
@sama
6.3M Followers
New York Post
@nypost
4.2M Followers
OpenAI
@OpenAI
5.4M Followers
zerohedge
@zerohedge
3.4M Followers
Wall St Engine
@wallstengine
198.9K Followers
SpaceXAI
@SpaceXAI
2.1M Followers
First Squawk
@FirstSquawk
569.4K Followers
Anthropic
@AnthropicAI
1.8M Followers
Ansem 🐂🀄️
@blknoiz06
1.4M Followers
Polymarket
@Polymarket
2M Followers
Kalshi
@Kalshi
472.8K Followers