注册并分享邀请链接,可获得视频播放与邀请奖励。

Xudong Han
@Xudong07452910
🎓PhD ing @ University of Sussex | LLM & AI Agents 📖AI Agent Product Development 🛠️Sharing AI tech insights 📩DM for collab
加入 November 2020
630 正在关注    12.5K 粉丝
很多时候,小模型缺的可能就是一套能把能力稳定调出来的 Harness。 这篇《AI4AI at Test-Time》研究了一个很有意思的问题: 能不能让更强的模型,直接给弱模型设计一套更好的工作方式? 作者让 GPT-5.5、Claude Opus、Gemini 等强模型自动修改 Harness,包括 Prompt、任务路由、验证规则和确定性代码。整个过程不更新目标模型的权重。 结果 GPT-5.4-mini 原始平均准确率只有 48.8%,加入自动设计的 Harness 后最高达到 91.2%,甚至超过了裸跑的 GPT-5.4。 而且效果好的 Harness 往往会把一些容易出错的推理交给代码和规则处理,让模型只负责它真正擅长的部分。 所以强模型学到的能力是可以被外化成 Prompt、代码、工具和工作流,再交给更便宜的小模型长期复用。 以后就可以让大模型帮其他模型设计更好的「工作环境」。 📎 arxiv:
显示更多
0
17
135
30
转发到社区