註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 AgentHarness
AgentHarness 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 AgentHarness 的搜尋結果
Agent 用久了以后,难点会变成稳定、可控、可复盘 ECC 做的是 agent harness performance optimization system 面向 Claude Code、Codex、OpenCode、Cursor 这些工具 README 里写到 61 agents、246 skills、dashboard GUI、operator workflows、optimization skill pack 和 status snapshots GitHub 现在约 194k stars,今天新增 1.9k stars。已经在搭多 agent 工作流的人,可以拆一下它的 skills、memory、安全和 benchmark 做法。 仓库地址:
顯示更多
Pi Agent 的 Sub-agent 我一直在用,最近我又拿 Apodex 1.1 跑了一轮多 Agent 搜索。 它处理资料对比的方式,和普通 Deep Research 不太一样。 Pi Agent 本身没有内置 Sub-agent,需要通过插件扩展。你可以让 scout 搜资料,researcher 整理信息,再交给 reviewer 检查。每个角色使用什么模型、开放哪些工具和权限,都能自己配置。 这种方式很灵活,适合喜欢自己搭 Agent 工作流的人。 这次我给 Apodex 1.1 的任务,是核对 Pi Agent、Codex CLI、Claude Code 和 FrontierAgent 的多 Agent 能力。 这些工具更新都很快。同一项功能可能在旧文档里没有,最新版本已经加入,也可能只是插件支持,最后却被写成官方内置。 所以我从一开始就限制了资料范围,只接受官方文档、GitHub 仓库和版本更新记录。 Apodex 会根据问题拆分搜索路线。多个 Agent 分头查不同工具,阶段结果持续汇总到同一个任务中,最后再集中比较。 我这次想看的,是它能不能把一个资料多、版本杂的任务持续做完,并把每条结论的来源留下来。 最终表格会单独区分官方内置和插件实现。不同官方页面出现冲突时,它会列出各自的来源和更新时间。官方没有明确说明的地方直接标成未知,不会为了填满表格补一个答案。 交付结果还会经过 Statement Review。关键结论与生成过程分开检查,遇到证据不足、引用不匹配或资料冲突时,会留下对应的检查记录。 两种多 Agent 的使用方向也很清楚。 Pi Agent 适合自己组建团队。角色、模型和权限都能深度调整。 Apodex 更适合多路搜索,把分散的资料放到一起比较,再交付一份可以继续核查的结果。 如果你经常需要确认某项能力究竟是官方支持、插件提供,还是目前没有明确资料,这种工作方式会比较实用。 FrontierAgent 是开源的单机 Agent harness,支持 ReAct 和 Agent Team。macOS、Linux 可以一条命令运行,无需强制预装 Docker。觉得有用可以去 GitHub 点个 Star。 Apodex 1.1 mini 是开放权重的 35B 模型,可以本地部署,也能搭配 FrontierAgent 使用。 Apodex 1.1 在线工作台已经上线。注册新用户有 credits,可以上传自己的文档、数据或表格跑一次。API 平台目前免费两周。
顯示更多
0
26
42
12
轉發到社區
做 Agent Harness 太有意思了,有种找到大学时候玩 Linux 的感觉了。
0
30
218
6
轉發到社區
这个博客讲 Agent Harness 自进化中比较重要的一个问题: Harness 跑分提高了,到底哪里真的变好了? 作者提出 Harness-Delta Attribution,把一次提升拆成三部分:过拟合、更多 test-time compute,以及最后真正能泛化的改进。 结果是在 ALFWorld 和 LiveMath 上,大量提升其实来自 Harness 学会了数据集里的规律和 shortcut;CREATE 上,不少收益单纯增加模型调用次数就能拿回来。 到了 held-out test,16 组实验里甚至有 4 组进化后的 Harness 比原来的 baseline 更差。 SWE-bench 上能看到比较明显的可泛化提升,但主要集中在能力较弱、还有提升空间的模型。 我觉得这对 Agent 自进化研究有一个提醒。 以后看到「Harness 自动进化后 +20%」,需要多问一步:这 20% 里有多少学到了可复用的方法,有多少只是记住 Benchmark,或者花了更多 Token 和调用次数。 文章:
顯示更多
0
22
101
18
轉發到社區
如果您在做 Agent Harness 相关的开源项目,希望在 DeepSeek Harness 发布的第一时间进行接入支持,请回复您的 GitHub id 以及 GitHub 项目地址,包括但不限于 plugin, skill, MCP, orchestrator, aggregator, UI 等等。 我们会选择一些开源项目的作者邀请参与DSH内测,并赠送部分API额度,让您可以做到在DSH发布时第一时间接入支持。 请同时私信我您的邮箱,我们会使用 email 联系您。
顯示更多
0
855
1.6K
117
轉發到社區
如果你是 Agent Harness 相关开源项目的开发者,希望参加 DeepSeek Harness 的内测,可以回复或私信联系我。请附上 GitHub id 以及开源代表作。
0
1.2K
3.1K
320
轉發到社區
想要学习怎么写 agent,可以参考这 几个开源 agent: - Codex、OpenCode:完整的生产级 coding agent。 - pi:更小、更清晰的 Agent harness,反而最适合入门。 - Hermes:偏通用个人 Agent,不是纯 coding agent;适合学习记忆、Skills、Provider 和多平台接入。 先建立 Agent 的最小模型 Agent 最核心的逻辑其实就是: 用户消息 ↓ 组装 messages + system prompt + tool schemas ↓ 调用模型 ↓ 模型返回文字或 tool calls ↓ 执行工具 ↓ 把 tool results 加回 messages ↓ 再次调用模型 ↓ 直到模型不再调用工具 生产级 Agent 的复杂度,都是围绕这个循环增加的: - Streaming - 工具参数验证 - 并行工具执行 - Abort、重试、超时 - 权限审批与 sandbox - Context compaction - Session 持久化与恢复 - Steering、follow-up - Subagent - Provider 差异适配
顯示更多
想写自己的agent harness,看了pi的代码,然后觉得没必要写了
现在很多人优化 Agent 成本,第一反应是: 换更便宜的模型,或者做 model routing。 但这篇论文提醒了一个更容易被忽略的地方: Agent 真正烧钱的,是整个执行循环。 一次 Agent 任务里,可能包含多轮对话、工具调用、上下文回放、历史压缩、重试、等待、子任务委派。 这些东西怎么组织,决定权大多在 harness / orchestration layer 这一层。 论文把这个现象叫做 token maxing: 模型单 token 价格在下降,但 Agent 为了完成更复杂的任务,会塞进更多上下文、更多工具信息、更多 reasoning trace。最后每个任务消耗的 token 反而越来越多。 实验设计很直接。 作者用 22 个企业 Agent 任务,测试 6 个模型,包括 Claude、Gemini、Qwen、GLM、Palmyra 等。然后只替换 orchestration layer:一边是普通 production agent loop,一边是 Writer Agent Harness。 结果很明显: 换上 Writer Agent Harness 后,平均任务成本从 $0.21 降到 $0.12,token 从 14.2k 降到 8.8k,耗时从 48 秒降到 27 秒;任务质量基本持平,quality per dollar 提升 82%。 这个差异主要来自几个很工程化的设计: 稳定内容放进可缓存 prefix,变化内容放在 tail;旧历史做结构化压缩;大块上下文尽量 offload;等待和重试阶段要有预算控制。 这篇最有意思的地方在于,它把 Agent 成本问题从「选哪个模型」推进到了「怎么组织一次任务执行」。 这对 AI coding、Research Agent、多智能体系统都很关键。 之后做 Agent,不能只盯模型榜单。真正拉开差距的地方,会越来越多地出现在 context engineering、tool exposure、cache discipline、failure governance 和 workflow orchestration 这些层面。 Agent 越复杂,harness 越像基础设施。 模型决定能力上限,harness 决定接近这个上限要花多少钱。 📎 arxiv:
顯示更多
0
4
86
19
轉發到社區
DeepSeek 招 Agent Harness 研究员,能是世界范围内第一次招聘“Harness研究员” ● 招聘岗位:Agent Harness 研究员(实习/全职) ● 工作性质:全职 | 实习 ● 工作地点:浙江·杭州市 / 北京市 ================================ 【团队使命】 Model + Harness = Agent 我们正在把 DeepSeek 的前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。 你将加入 Harness 团队,与研究员、工程师、产品经理紧密协作,探索 Harness 领域的研究前沿,定义 DeepSeek 对 Harness 的理解。 ================================ 【主要职责】 - 前沿创新:与 Harness 团队的研究员与工程师深度沟通、紧密合作,共同定义和实现 Harness 领域基于模型能力的前沿创新,包括但不限于上下文管理、长期记忆、Subagent 与 Multi-Agent、自进化 Agent 等领域。 - 深度适配:与模型训练团队的研究员与工程师深度沟通与合作,实现模型与 Harness 的共同进化,从 Harness 的角度实现 DeepSeek 的 Harness 与模型的深度适配。 - 评测构建:提出 Harness 领域的基准测试与评测方法,构建评测基准数据和制定数据标注策略,从 Harness 的角度研究并优化 Agent 在各领域的智能水平。 - 真实迭代:以真实世界的任务作为 Harness 研究的重要反馈源,设计相关数据与实验,持续迭代 Agent 能力在真实使用场景下的表现。 - 用户优化:基于团队收集到的用户反馈,从 Harness 的角度研究并优化为最广大用户解决真实场景问题的能力。 ================================ 【任职要求】 - 科研背景:硕士学历及以上,2年以上计算机科学或相关领域的科研经验,水平过硬,眼界广阔,有科研品味;在计算机科学领域具有含金量的论文发表(特别优秀候选人可放宽学历及年限要求)。 - 独立推进:面对问题能够独立分析并提出自己的 idea,具备从 0 到 1 推动研究的能力;能够快速将想法转化为可运行的原型,具备高效的实验迭代能力。 - 全栈开发:熟练使用 AI Agent 工具进行软件开发,在软件开发领域具有极强的学习能力;能够在 AI 辅助下,在没有直接经验的领域(如语言、技术、框架等)进行研究目的的编程工作。 - 重度用户:是 Agent 产品的高强度用户,对 Agent Harness 的开发和研究有极大的热情,对模型行为有品味有判断力;深度使用过代码类及通用类 Agent 产品,并将相关产品的使用融入到自己的工作和生活中。 - 知识储备:熟悉 LLM 以及 Agent 基本机制及其技术原理(包括 LLM API、KV Cache、Agent Loop、Tool Use、Reasoning、Planning、Skills、MCP、Memory、Subagent、Multi-Agent 等);对 Prompt Engineering、Context Engineering、Harness Engineering 等课题有深入的理解。 - 沟通能力:具备良好的中文沟通能力。 ================================ 【加分项】 - AI 领域相关科研经验,或 AI 行业的研究员任职经验。 - 拥有个人开源作品,或对开源社区有深度贡献。 - 在计算机科学领域、编程领域、或数据科学领域获得过具有含金量的比赛奖项。 - 其它超乎常人的与此工作相关的才能。
顯示更多
0
25
207
37
轉發到社區