TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
가입 November 2020
630
팔로잉 중
12.5K
팬
Xudong Han
@Xudong07452910
2026.08.07 03:30
很多模型单项能力不差,一进入长任务,却容易卡在上一种思路里。 比如先做数学推导,再安排计划,最后从文档中提取信息。每一步单独完成都不算难,连在一起以后,模型常把前一步的解题方式和输出格式带到下一步。 普林斯顿等团队这篇论文提出了「Skill Entropy」,用来衡量模型从一种技能切换到另一种技能有多难。 他们还构建了 Skill2-Bench,覆盖数学、编程、科学、规划、信息提取和写作等 9 个领域,共 558 项技能。 实验发现,同一项技能放进跨技能长任务后,准确率会下降约 4%~13%。技能切换越困难,模型表现通常越差。 为了解决这个问题,作者提出 Skill-Entropy RL:模型在每一步回答前,先判断当前需要调用什么技能,再根据答案正确性和技能切换是否合理获得奖励。 训练后,Qwen3-4B 的得分从 34.4% 提升到 68.4%,Qwen3-1.7B 也从 14.6% 提升到 40.1%。 这项工作把长时推理的瓶颈从「会不会做」,进一步拆成了「能不能及时换挡」。 对于更强的 Agent,需要积累足够多的技能,也要知道什么时候结束上一种思路,切到下一种。 📎 arxiv:
더 보기
0
0
50
102
21
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
吴说区块链
@wublockchain12
181.5K 팬
TVer新着
@TVer_info
100.9K 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K 팬
Reuters
@Reuters
26.4M 팬
First Squawk
@FirstSquawk
569.5K 팬
Bloomberg
@business
10.5M 팬
billboard
@billboard
16.8M 팬
空空道人
@Kongkongda5882
34.3K 팬
中國新聞社
@CNS1952
547.7K 팬
一劍浣春秋
@chee828
231.9K 팬
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K 팬
zerohedge
@zerohedge
3.4M 팬
モデルプレス
@modelpress
2.1M 팬