现在很多人优化 Agent 成本,第一反应是:
换更便宜的模型,或者做 model routing。
但这篇论文提醒了一个更容易被忽略的地方:
Agent 真正烧钱的,是整个执行循环。
一次 Agent 任务里,可能包含多轮对话、工具调用、上下文回放、历史压缩、重试、等待、子任务委派。
这些东西怎么组织,决定权大多在 harness / orchestration layer 这一层。
论文把这个现象叫做 token maxing:
模型单 token 价格在下降,但 Agent 为了完成更复杂的任务,会塞进更多上下文、更多工具信息、更多 reasoning trace。最后每个任务消耗的 token 反而越来越多。
实验设计很直接。
作者用 22 个企业 Agent 任务,测试 6 个模型,包括 Claude、Gemini、Qwen、GLM、Palmyra 等。然后只替换 orchestration layer:一边是普通 production agent loop,一边是 Writer Agent Harness。
结果很明显:
换上 Writer Agent Harness 后,平均任务成本从 $0.21 降到 $0.12,token 从 14.2k 降到 8.8k,耗时从 48 秒降到 27 秒;任务质量基本持平,quality per dollar 提升 82%。
这个差异主要来自几个很工程化的设计:
稳定内容放进可缓存 prefix,变化内容放在 tail;旧历史做结构化压缩;大块上下文尽量 offload;等待和重试阶段要有预算控制。
这篇最有意思的地方在于,它把 Agent 成本问题从「选哪个模型」推进到了「怎么组织一次任务执行」。
这对 AI coding、Research Agent、多智能体系统都很关键。
之后做 Agent,不能只盯模型榜单。真正拉开差距的地方,会越来越多地出现在 context engineering、tool exposure、cache discipline、failure governance 和 workflow orchestration 这些层面。
Agent 越复杂,harness 越像基础设施。
模型决定能力上限,harness 决定接近这个上限要花多少钱。
📎 arxiv:
显示更多