Agent 用久了以后,难点会变成稳定、可控、可复盘
ECC 做的是 agent harness performance optimization system
面向 Claude Code、Codex、OpenCode、Cursor 这些工具
README 里写到 61 agents、246 skills、dashboard GUI、operator workflows、optimization skill pack 和 status snapshots
GitHub 现在约 194k stars,今天新增 1.9k stars。已经在搭多 agent 工作流的人,可以拆一下它的 skills、memory、安全和 benchmark 做法。
仓库地址:
顯示更多
Pi Agent 的 Sub-agent 我一直在用,最近我又拿 Apodex 1.1 跑了一轮多 Agent 搜索。
它处理资料对比的方式,和普通 Deep Research 不太一样。
Pi Agent 本身没有内置 Sub-agent,需要通过插件扩展。你可以让 scout 搜资料,researcher 整理信息,再交给 reviewer 检查。每个角色使用什么模型、开放哪些工具和权限,都能自己配置。
这种方式很灵活,适合喜欢自己搭 Agent 工作流的人。
这次我给 Apodex 1.1 的任务,是核对 Pi Agent、Codex CLI、Claude Code 和 FrontierAgent 的多 Agent 能力。
这些工具更新都很快。同一项功能可能在旧文档里没有,最新版本已经加入,也可能只是插件支持,最后却被写成官方内置。
所以我从一开始就限制了资料范围,只接受官方文档、GitHub 仓库和版本更新记录。
Apodex 会根据问题拆分搜索路线。多个 Agent 分头查不同工具,阶段结果持续汇总到同一个任务中,最后再集中比较。
我这次想看的,是它能不能把一个资料多、版本杂的任务持续做完,并把每条结论的来源留下来。
最终表格会单独区分官方内置和插件实现。不同官方页面出现冲突时,它会列出各自的来源和更新时间。官方没有明确说明的地方直接标成未知,不会为了填满表格补一个答案。
交付结果还会经过 Statement Review。关键结论与生成过程分开检查,遇到证据不足、引用不匹配或资料冲突时,会留下对应的检查记录。
两种多 Agent 的使用方向也很清楚。
Pi Agent 适合自己组建团队。角色、模型和权限都能深度调整。
Apodex 更适合多路搜索,把分散的资料放到一起比较,再交付一份可以继续核查的结果。
如果你经常需要确认某项能力究竟是官方支持、插件提供,还是目前没有明确资料,这种工作方式会比较实用。
FrontierAgent 是开源的单机 Agent harness,支持 ReAct 和 Agent Team。macOS、Linux 可以一条命令运行,无需强制预装 Docker。觉得有用可以去 GitHub 点个 Star。
Apodex 1.1 mini 是开放权重的 35B 模型,可以本地部署,也能搭配 FrontierAgent 使用。
Apodex 1.1 在线工作台已经上线。注册新用户有 credits,可以上传自己的文档、数据或表格跑一次。API 平台目前免费两周。
顯示更多
做 Agent Harness 太有意思了,有种找到大学时候玩 Linux 的感觉了。
这个博客讲 Agent Harness 自进化中比较重要的一个问题:
Harness 跑分提高了,到底哪里真的变好了?
作者提出 Harness-Delta Attribution,把一次提升拆成三部分:过拟合、更多 test-time compute,以及最后真正能泛化的改进。
结果是在 ALFWorld 和 LiveMath 上,大量提升其实来自 Harness 学会了数据集里的规律和 shortcut;CREATE 上,不少收益单纯增加模型调用次数就能拿回来。
到了 held-out test,16 组实验里甚至有 4 组进化后的 Harness 比原来的 baseline 更差。
SWE-bench 上能看到比较明显的可泛化提升,但主要集中在能力较弱、还有提升空间的模型。
我觉得这对 Agent 自进化研究有一个提醒。
以后看到「Harness 自动进化后 +20%」,需要多问一步:这 20% 里有多少学到了可复用的方法,有多少只是记住 Benchmark,或者花了更多 Token 和调用次数。
文章:
顯示更多
如果您在做 Agent Harness 相关的开源项目,希望在 DeepSeek Harness 发布的第一时间进行接入支持,请回复您的 GitHub id 以及 GitHub 项目地址,包括但不限于 plugin, skill, MCP, orchestrator, aggregator, UI 等等。
我们会选择一些开源项目的作者邀请参与DSH内测,并赠送部分API额度,让您可以做到在DSH发布时第一时间接入支持。
请同时私信我您的邮箱,我们会使用 email 联系您。
顯示更多
如果你是 Agent Harness 相关开源项目的开发者,希望参加 DeepSeek Harness 的内测,可以回复或私信联系我。请附上 GitHub id 以及开源代表作。
想要学习怎么写 agent,可以参考这 几个开源 agent:
- Codex、OpenCode:完整的生产级 coding agent。
- pi:更小、更清晰的 Agent harness,反而最适合入门。
- Hermes:偏通用个人 Agent,不是纯 coding agent;适合学习记忆、Skills、Provider 和多平台接入。
先建立 Agent 的最小模型
Agent 最核心的逻辑其实就是:
用户消息
↓
组装 messages + system prompt + tool schemas
↓
调用模型
↓
模型返回文字或 tool calls
↓
执行工具
↓
把 tool results 加回 messages
↓
再次调用模型
↓
直到模型不再调用工具
生产级 Agent 的复杂度,都是围绕这个循环增加的:
- Streaming
- 工具参数验证
- 并行工具执行
- Abort、重试、超时
- 权限审批与 sandbox
- Context compaction
- Session 持久化与恢复
- Steering、follow-up
- Subagent
- Provider 差异适配
顯示更多
想写自己的agent harness,看了pi的代码,然后觉得没必要写了
现在很多人优化 Agent 成本,第一反应是:
换更便宜的模型,或者做 model routing。
但这篇论文提醒了一个更容易被忽略的地方:
Agent 真正烧钱的,是整个执行循环。
一次 Agent 任务里,可能包含多轮对话、工具调用、上下文回放、历史压缩、重试、等待、子任务委派。
这些东西怎么组织,决定权大多在 harness / orchestration layer 这一层。
论文把这个现象叫做 token maxing:
模型单 token 价格在下降,但 Agent 为了完成更复杂的任务,会塞进更多上下文、更多工具信息、更多 reasoning trace。最后每个任务消耗的 token 反而越来越多。
实验设计很直接。
作者用 22 个企业 Agent 任务,测试 6 个模型,包括 Claude、Gemini、Qwen、GLM、Palmyra 等。然后只替换 orchestration layer:一边是普通 production agent loop,一边是 Writer Agent Harness。
结果很明显:
换上 Writer Agent Harness 后,平均任务成本从 $0.21 降到 $0.12,token 从 14.2k 降到 8.8k,耗时从 48 秒降到 27 秒;任务质量基本持平,quality per dollar 提升 82%。
这个差异主要来自几个很工程化的设计:
稳定内容放进可缓存 prefix,变化内容放在 tail;旧历史做结构化压缩;大块上下文尽量 offload;等待和重试阶段要有预算控制。
这篇最有意思的地方在于,它把 Agent 成本问题从「选哪个模型」推进到了「怎么组织一次任务执行」。
这对 AI coding、Research Agent、多智能体系统都很关键。
之后做 Agent,不能只盯模型榜单。真正拉开差距的地方,会越来越多地出现在 context engineering、tool exposure、cache discipline、failure governance 和 workflow orchestration 这些层面。
Agent 越复杂,harness 越像基础设施。
模型决定能力上限,harness 决定接近这个上限要花多少钱。
📎 arxiv:
顯示更多
DeepSeek 招 Agent Harness 研究员,能是世界范围内第一次招聘“Harness研究员”
● 招聘岗位:Agent Harness 研究员(实习/全职)
● 工作性质:全职 | 实习
● 工作地点:浙江·杭州市 / 北京市
================================
【团队使命】
Model + Harness = Agent
我们正在把 DeepSeek 的前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。
你将加入 Harness 团队,与研究员、工程师、产品经理紧密协作,探索 Harness 领域的研究前沿,定义 DeepSeek 对 Harness 的理解。
================================
【主要职责】
- 前沿创新:与 Harness 团队的研究员与工程师深度沟通、紧密合作,共同定义和实现 Harness 领域基于模型能力的前沿创新,包括但不限于上下文管理、长期记忆、Subagent 与 Multi-Agent、自进化 Agent 等领域。
- 深度适配:与模型训练团队的研究员与工程师深度沟通与合作,实现模型与 Harness 的共同进化,从 Harness 的角度实现 DeepSeek 的 Harness 与模型的深度适配。
- 评测构建:提出 Harness 领域的基准测试与评测方法,构建评测基准数据和制定数据标注策略,从 Harness 的角度研究并优化 Agent 在各领域的智能水平。
- 真实迭代:以真实世界的任务作为 Harness 研究的重要反馈源,设计相关数据与实验,持续迭代 Agent 能力在真实使用场景下的表现。
- 用户优化:基于团队收集到的用户反馈,从 Harness 的角度研究并优化为最广大用户解决真实场景问题的能力。
================================
【任职要求】
- 科研背景:硕士学历及以上,2年以上计算机科学或相关领域的科研经验,水平过硬,眼界广阔,有科研品味;在计算机科学领域具有含金量的论文发表(特别优秀候选人可放宽学历及年限要求)。
- 独立推进:面对问题能够独立分析并提出自己的 idea,具备从 0 到 1 推动研究的能力;能够快速将想法转化为可运行的原型,具备高效的实验迭代能力。
- 全栈开发:熟练使用 AI Agent 工具进行软件开发,在软件开发领域具有极强的学习能力;能够在 AI 辅助下,在没有直接经验的领域(如语言、技术、框架等)进行研究目的的编程工作。
- 重度用户:是 Agent 产品的高强度用户,对 Agent Harness 的开发和研究有极大的热情,对模型行为有品味有判断力;深度使用过代码类及通用类 Agent 产品,并将相关产品的使用融入到自己的工作和生活中。
- 知识储备:熟悉 LLM 以及 Agent 基本机制及其技术原理(包括 LLM API、KV Cache、Agent Loop、Tool Use、Reasoning、Planning、Skills、MCP、Memory、Subagent、Multi-Agent 等);对 Prompt Engineering、Context Engineering、Harness Engineering 等课题有深入的理解。
- 沟通能力:具备良好的中文沟通能力。
================================
【加分项】
- AI 领域相关科研经验,或 AI 行业的研究员任职经验。
- 拥有个人开源作品,或对开源社区有深度贡献。
- 在计算机科学领域、编程领域、或数据科学领域获得过具有含金量的比赛奖项。
- 其它超乎常人的与此工作相关的才能。
顯示更多