TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
参加 November 2020
630
フォロー中
12.5K
ファン
Xudong Han
@Xudong07452910
2026.09.23 11:32
Agent 自我进化也会过拟合。 Harness 在同一批任务上反复修改,Benchmark 分数可能一路上涨;换到新任务后,刚学到的能力却很快失效。 Google Cloud AI Research 等团队这篇 RRSI,专门给 Harness Evolution 加了一套「正则化」。 它主要从两端限制自我改进: Proposer 负责提出修改。前期允许一次尝试更多变化,后期逐渐收紧每轮能改的组件数量;同时参考历史进化轨迹,鼓励探索还没试过的方向,减少反复走同一条路。 Selector 决定哪些修改能留下。其中有两个关键角色: Critic 会过滤明显针对 Benchmark 写死的技巧,避免 Harness 靠记题刷分; Pruner 会删掉收益太小、token 成本太高,或者后续已经没有价值的改动,防止 Harness 越进化越臃肿。 所以它最终想保留的,是能跨任务复用的机制。 结果在普通 Harness Evolution 在训练任务上分数更高,但 OOD 平均只有 40.3;RRSI 达到 43.6,同时推理 token 还减少了约 30%。 有一个直接的感受是自我进化做到后面,难的是决定什么值得继承。 换了环境还能留下来的改动,才更有价值。 📎 arxiv:
もっと見る
0
0
5
21
6
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
Reuters
@Reuters
26.4M ファン
吴说区块链
@wublockchain12
181.5K ファン
First Squawk
@FirstSquawk
569.4K ファン
ファミ通.com
@famitsu
1.4M ファン
Bloomberg
@business
10.5M ファン
モデルプレス
@modelpress
2.1M ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
billboard
@billboard
16.8M ファン
一劍浣春秋
@chee828
0 ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
Yahoo!ニュース
@YahooNewsTopics
2.1M ファン