注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 Agent
Agent 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 Agent 的推特
Agent 自我进化也会过拟合。 Harness 在同一批任务上反复修改,Benchmark 分数可能一路上涨;换到新任务后,刚学到的能力却很快失效。 Google Cloud AI Research 等团队这篇 RRSI,专门给 Harness Evolution 加了一套「正则化」。 它主要从两端限制自我改进: Proposer 负责提出修改。前期允许一次尝试更多变化,后期逐渐收紧每轮能改的组件数量;同时参考历史进化轨迹,鼓励探索还没试过的方向,减少反复走同一条路。 Selector 决定哪些修改能留下。其中有两个关键角色: Critic 会过滤明显针对 Benchmark 写死的技巧,避免 Harness 靠记题刷分; Pruner 会删掉收益太小、token 成本太高,或者后续已经没有价值的改动,防止 Harness 越进化越臃肿。 所以它最终想保留的,是能跨任务复用的机制。 结果在普通 Harness Evolution 在训练任务上分数更高,但 OOD 平均只有 40.3;RRSI 达到 43.6,同时推理 token 还减少了约 30%。 有一个直接的感受是自我进化做到后面,难的是决定什么值得继承。 换了环境还能留下来的改动,才更有价值。 📎 arxiv:
显示更多
Agent 会自己安装mlx-whisper转写视频文稿... 还挺方便的。 操作系统是 macOS Golden Gate 27.0,liquid Glass风格也慢慢成熟了些。
Agentic 能力 = 在模糊环境中自主定义问题 → 规划路径 → 调用资源 → 执行 → 迭代修正的完整能力。 虽然指 AI Agent 的能力,其实人也很需要。 现在硅谷现在公司招人,都很看重人的Agentic能力。
显示更多
Agent 之前其实是可以聊天沟通一起开发的,根据我的经验,通常两个就够了,再多 ROI 就低了。
0
42
16
0
转发到社区
Agent 自进化,并不会每一轮都变得更强。 这篇《Rethinking Self-Evolving Agent Skills》专门研究 Skill 在多轮迭代里到底是怎么进化的。 作者做了 42 组 evolution run,一共生成 388 个候选 Skill,真正刷新验证集最好结果的只有 55 个。 也就是说,大部分修改其实没有带来有效提升,很多轮次会停滞、退化,最后被回滚。 还有一个很有意思的结果: 最终被选中的 11 个进化 Skill,全部使用了失败轨迹作为反馈;只看成功经验的方案一次都没有胜出。 失败轨迹更像是在告诉 Agent「哪里需要修」,成功轨迹则更适合保留已有能力。 这也说明了自进化更像一场带验证和回滚机制的搜索。 重点不在多迭代几轮,而在每次修改之后,能不能证明这条经验真的值得留下。 📎 arxiv:
显示更多
0
19
99
16
转发到社区
Agent 写了几百行代码,不看心里没底,看了又等于白让它干活。 old-coder 换了个思路:不读代码,让 Agent 自己跑一套考核流程。 灵感来自 Uncle Bob,用测试、覆盖率、变异测试把 Agent 围起来,能通过这套关卡的代码就可信。 GitHub: 在 Agent 动手前会先写一份测试计划交过来,让我们确认批准了才开工。 完事后自动跑全套检查,最后交一份带数据的证据报告。 兼容 Claude Code、Codex、Cursor,纯 Markdown 实现,装上就能用。 适合在用 AI 编程但又放心不下代码质量的朋友。
显示更多
0
58
103
20
转发到社区
Agent 写了几百行代码,不看心里没底,看了又等于白让它干活。 old-coder 换了个思路:不读代码,让 Agent 自己跑一套考核流程。 灵感来自 Uncle Bob,用测试、覆盖率、变异测试把 Agent 围起来,能通过这套关卡的代码就可信。 GitHub: 在 Agent 动手前会先写一份测试计划交过来,让我们确认批准了才开工。 完事后自动跑全套检查,最后交一份带数据的证据报告。 兼容 Claude Code、Codex、Cursor,纯 Markdown 实现,装上就能用。 适合在用 AI 编程但又放心不下代码质量的朋友。
显示更多
0
13
53
6
转发到社区
Agent 能自己跑命令、自己调工具以后,一个绕不开的问题冒出来了:它要是被人骗了怎么办,跑飞了谁负责。 这一攻一防四个项目值得一起看: 防的一侧 1、microsoft/agent-governance-toolkit — 微软出的 Agent 治理工具包,做策略强制、零信任身份、执行沙箱,声称覆盖了 OWASP Agentic Top 10 的全部十项 2、uber/ADR — Uber 开源的企业 Agent 安全方案,做可观测性、安全基准测试和威胁检测,已经在 Uber 内部生产环境部署 3、慢雾的 OpenClaw 安全实践指南 — 特别之处是它明确说了这份指南是写给 Agent 自己看的,不是传统那种只给人用的加固清单 攻的一侧 4、hexstrike-ai — 让 AI agent 自主调用 150 多个网络安全工具做渗透测试和漏洞挖掘。它同时说明了防守这侧为什么必须跟上 给 AI 装手脚的人很多,想着给它装刹车的还太少。
显示更多
Agent 出错以后,到底该修模型,还是修 harness? Scale AI 这篇《Model or Harness?》专门研究 Agent 的故障定位。 今天的 Agent 已经是一个复杂系统:模型之外,还有 Context、Memory、Tool、Grader、用户和运行环境。最后看到的失败结果相同,背后的原因可能完全不同。 比如 Agent 忽略了一条早期指令。 可能是上下文压缩把它删掉了,需要改 harness;也可能信息一直都在,只是模型没有正确使用,这时才该训练模型。 论文整理了 41 类常见失败,并把每个问题定位到具体的「组件交互 + 责任方」。 这样一次失败就能进一步回答: 该做模型 post-training,改 context / memory / tool,还是重新设计环境和评测。 作者还让不同前沿模型独立给失败案例分类,最好的结果与人工标注达到 Cohen’s κ = 0.76,说明这套分类有一定一致性。 我觉得这篇很适合现在的 Agent 发展阶段。 随着 harness 越做越复杂,「Agent 失败了」这个结论已经太粗了。 真正有用的 debugging,要继续追到第一处无法恢复的错误,再决定到底该修哪一层。 📎 arxiv:
显示更多
0
83
446
76
转发到社区
Agent Plugins 是由 OpenAI、AWS、Cursor、GitHub、VS Code 和 Vercel 等厂商共同推动的开放标准,把 Agent Skills 和 MCP 服务器配置打包成一次构建、多个 AI Agent 客户端间通用的可移植插件。
显示更多