Agent 自我进化也会过拟合。
Harness 在同一批任务上反复修改,Benchmark 分数可能一路上涨;换到新任务后,刚学到的能力却很快失效。
Google Cloud AI Research 等团队这篇 RRSI,专门给 Harness Evolution 加了一套「正则化」。
它主要从两端限制自我改进:
Proposer 负责提出修改。前期允许一次尝试更多变化,后期逐渐收紧每轮能改的组件数量;同时参考历史进化轨迹,鼓励探索还没试过的方向,减少反复走同一条路。
Selector 决定哪些修改能留下。其中有两个关键角色:
Critic 会过滤明显针对 Benchmark 写死的技巧,避免 Harness 靠记题刷分;
Pruner 会删掉收益太小、token 成本太高,或者后续已经没有价值的改动,防止 Harness 越进化越臃肿。
所以它最终想保留的,是能跨任务复用的机制。
结果在普通 Harness Evolution 在训练任务上分数更高,但 OOD 平均只有 40.3;RRSI 达到 43.6,同时推理 token 还减少了约 30%。
有一个直接的感受是自我进化做到后面,难的是决定什么值得继承。
换了环境还能留下来的改动,才更有价值。
📎 arxiv:
顯示更多
Agent 会自己安装mlx-whisper转写视频文稿...
还挺方便的。
操作系统是 macOS Golden Gate 27.0,liquid Glass风格也慢慢成熟了些。
Agentic 能力 = 在模糊环境中自主定义问题 → 规划路径 → 调用资源 → 执行 → 迭代修正的完整能力。
虽然指 AI Agent 的能力,其实人也很需要。
现在硅谷现在公司招人,都很看重人的Agentic能力。
顯示更多
Agent 之前其实是可以聊天沟通一起开发的,根据我的经验,通常两个就够了,再多 ROI 就低了。
Agent 自进化,并不会每一轮都变得更强。
这篇《Rethinking Self-Evolving Agent Skills》专门研究 Skill 在多轮迭代里到底是怎么进化的。
作者做了 42 组 evolution run,一共生成 388 个候选 Skill,真正刷新验证集最好结果的只有 55 个。
也就是说,大部分修改其实没有带来有效提升,很多轮次会停滞、退化,最后被回滚。
还有一个很有意思的结果:
最终被选中的 11 个进化 Skill,全部使用了失败轨迹作为反馈;只看成功经验的方案一次都没有胜出。
失败轨迹更像是在告诉 Agent「哪里需要修」,成功轨迹则更适合保留已有能力。
这也说明了自进化更像一场带验证和回滚机制的搜索。
重点不在多迭代几轮,而在每次修改之后,能不能证明这条经验真的值得留下。
📎 arxiv:
顯示更多
Agent 写了几百行代码,不看心里没底,看了又等于白让它干活。
old-coder 换了个思路:不读代码,让 Agent 自己跑一套考核流程。
灵感来自 Uncle Bob,用测试、覆盖率、变异测试把 Agent 围起来,能通过这套关卡的代码就可信。
GitHub:
在 Agent 动手前会先写一份测试计划交过来,让我们确认批准了才开工。
完事后自动跑全套检查,最后交一份带数据的证据报告。
兼容 Claude Code、Codex、Cursor,纯 Markdown 实现,装上就能用。
适合在用 AI 编程但又放心不下代码质量的朋友。
顯示更多
Agent 写了几百行代码,不看心里没底,看了又等于白让它干活。
old-coder 换了个思路:不读代码,让 Agent 自己跑一套考核流程。
灵感来自 Uncle Bob,用测试、覆盖率、变异测试把 Agent 围起来,能通过这套关卡的代码就可信。
GitHub:
在 Agent 动手前会先写一份测试计划交过来,让我们确认批准了才开工。
完事后自动跑全套检查,最后交一份带数据的证据报告。
兼容 Claude Code、Codex、Cursor,纯 Markdown 实现,装上就能用。
适合在用 AI 编程但又放心不下代码质量的朋友。
顯示更多
Agent 能自己跑命令、自己调工具以后,一个绕不开的问题冒出来了:它要是被人骗了怎么办,跑飞了谁负责。
这一攻一防四个项目值得一起看:
防的一侧
1、microsoft/agent-governance-toolkit — 微软出的 Agent 治理工具包,做策略强制、零信任身份、执行沙箱,声称覆盖了 OWASP Agentic Top 10 的全部十项
2、uber/ADR — Uber 开源的企业 Agent 安全方案,做可观测性、安全基准测试和威胁检测,已经在 Uber 内部生产环境部署
3、慢雾的 OpenClaw 安全实践指南 — 特别之处是它明确说了这份指南是写给 Agent 自己看的,不是传统那种只给人用的加固清单
攻的一侧
4、hexstrike-ai — 让 AI agent 自主调用 150 多个网络安全工具做渗透测试和漏洞挖掘。它同时说明了防守这侧为什么必须跟上
给 AI 装手脚的人很多,想着给它装刹车的还太少。
顯示更多
Agent 出错以后,到底该修模型,还是修 harness?
Scale AI 这篇《Model or Harness?》专门研究 Agent 的故障定位。
今天的 Agent 已经是一个复杂系统:模型之外,还有 Context、Memory、Tool、Grader、用户和运行环境。最后看到的失败结果相同,背后的原因可能完全不同。
比如 Agent 忽略了一条早期指令。
可能是上下文压缩把它删掉了,需要改 harness;也可能信息一直都在,只是模型没有正确使用,这时才该训练模型。
论文整理了 41 类常见失败,并把每个问题定位到具体的「组件交互 + 责任方」。
这样一次失败就能进一步回答:
该做模型 post-training,改 context / memory / tool,还是重新设计环境和评测。
作者还让不同前沿模型独立给失败案例分类,最好的结果与人工标注达到 Cohen’s κ = 0.76,说明这套分类有一定一致性。
我觉得这篇很适合现在的 Agent 发展阶段。
随着 harness 越做越复杂,「Agent 失败了」这个结论已经太粗了。
真正有用的 debugging,要继续追到第一处无法恢复的错误,再决定到底该修哪一层。
📎 arxiv:
顯示更多
Agent Plugins 是由 OpenAI、AWS、Cursor、GitHub、VS Code 和 Vercel 等厂商共同推动的开放标准,把 Agent Skills 和 MCP 服务器配置打包成一次构建、多个 AI Agent 客户端间通用的可移植插件。
顯示更多