TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
参加 November 2020
630
フォロー中
12.5K
ファン
Xudong Han
@Xudong07452910
2026.08.07 03:30
很多模型单项能力不差,一进入长任务,却容易卡在上一种思路里。 比如先做数学推导,再安排计划,最后从文档中提取信息。每一步单独完成都不算难,连在一起以后,模型常把前一步的解题方式和输出格式带到下一步。 普林斯顿等团队这篇论文提出了「Skill Entropy」,用来衡量模型从一种技能切换到另一种技能有多难。 他们还构建了 Skill2-Bench,覆盖数学、编程、科学、规划、信息提取和写作等 9 个领域,共 558 项技能。 实验发现,同一项技能放进跨技能长任务后,准确率会下降约 4%~13%。技能切换越困难,模型表现通常越差。 为了解决这个问题,作者提出 Skill-Entropy RL:模型在每一步回答前,先判断当前需要调用什么技能,再根据答案正确性和技能切换是否合理获得奖励。 训练后,Qwen3-4B 的得分从 34.4% 提升到 68.4%,Qwen3-1.7B 也从 14.6% 提升到 40.1%。 这项工作把长时推理的瓶颈从「会不会做」,进一步拆成了「能不能及时换挡」。 对于更强的 Agent,需要积累足够多的技能,也要知道什么时候结束上一种思路,切到下一种。 📎 arxiv:
もっと見る
0
0
50
102
21
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
New York Post
@nypost
4.2M ファン
TVer新着
@TVer_info
100.9K ファン
ツイッター速報〜BreakingNews
@tweetsoku1
256.8K ファン
吴说区块链
@wublockchain12
181.5K ファン
Reuters
@Reuters
26.4M ファン
ファミ通.com
@famitsu
1.4M ファン
First Squawk
@FirstSquawk
569.5K ファン
PR TIMESテクノロジー
@PRTIMES_TECH
28.3K ファン
モデルプレス
@modelpress
2.1M ファン
Bloomberg
@business
10.5M ファン
billboard
@billboard
16.8M ファン
一劍浣春秋
@chee828
231.9K ファン
MANTANWEB/毎日キレイ
@mantanweb
68.9K ファン
空空道人
@Kongkongda5882
34.3K ファン