注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 ModelRouting
ModelRouting 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 ModelRouting 的推特
现在很多人优化 Agent 成本,第一反应是: 换更便宜的模型,或者做 model routing。 但这篇论文提醒了一个更容易被忽略的地方: Agent 真正烧钱的,是整个执行循环。 一次 Agent 任务里,可能包含多轮对话、工具调用、上下文回放、历史压缩、重试、等待、子任务委派。 这些东西怎么组织,决定权大多在 harness / orchestration layer 这一层。 论文把这个现象叫做 token maxing: 模型单 token 价格在下降,但 Agent 为了完成更复杂的任务,会塞进更多上下文、更多工具信息、更多 reasoning trace。最后每个任务消耗的 token 反而越来越多。 实验设计很直接。 作者用 22 个企业 Agent 任务,测试 6 个模型,包括 Claude、Gemini、Qwen、GLM、Palmyra 等。然后只替换 orchestration layer:一边是普通 production agent loop,一边是 Writer Agent Harness。 结果很明显: 换上 Writer Agent Harness 后,平均任务成本从 $0.21 降到 $0.12,token 从 14.2k 降到 8.8k,耗时从 48 秒降到 27 秒;任务质量基本持平,quality per dollar 提升 82%。 这个差异主要来自几个很工程化的设计: 稳定内容放进可缓存 prefix,变化内容放在 tail;旧历史做结构化压缩;大块上下文尽量 offload;等待和重试阶段要有预算控制。 这篇最有意思的地方在于,它把 Agent 成本问题从「选哪个模型」推进到了「怎么组织一次任务执行」。 这对 AI coding、Research Agent、多智能体系统都很关键。 之后做 Agent,不能只盯模型榜单。真正拉开差距的地方,会越来越多地出现在 context engineering、tool exposure、cache discipline、failure governance 和 workflow orchestration 这些层面。 Agent 越复杂,harness 越像基础设施。 模型决定能力上限,harness 决定接近这个上限要花多少钱。 📎 arxiv:
显示更多
0
4
86
19
转发到社区