注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 OSWorld
OSWorld 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 OSWorld 的推特
GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,并且学会了说人话,而 Terra 消失了。 GPT 6 Sol 和 Luna 使用了与 Astra 类似的训练方法,能力更强,对齐更好,价格更低。 在 AutomationBench中,GPT 6 Sol 的表现超越了 Opus 5 的同时,只用了其 9% 的成本,便宜10倍。 GPT 6 Sol 和 Luna 的语言风格和 Astra 相同,表达更清晰,黑话更少,言简意赅,减少不必要的细节。 GPT 6 Sol 在 OSWorld 2.0 等某些指标上不如 GPT 5.6 Sol,这是需要注意的。 OpenAI 这次还特别改进了缓存机制,实现了更高的缓存命中率(他们终于学会了ds的技术) 同时 A 社也在今天发布了 Opus 5.5,象征性地降价了 20%,缓存降价了 60%,在 Agent 任务中,综合下降约 40% 。 我们终于迎来了大模型的大降价时代,感谢竞争,感谢 DeepSeek 和 GLM,请不要停,请继续降。
显示更多
0
17
67
4
转发到社区
读知乎回答有感,浅谈一下后训练 benchmark Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。 AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。 代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。 至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。 现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。 这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。 为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
显示更多
0
42
310
35
转发到社区
开源巨头 ByteDance 刚推出来的全原生 GUI 自动化 Agent 框架,直接靠看屏幕截图就能像真人一样抠键盘、甩鼠标操作电脑。不需要繁琐的代码封装,端到端直接跑通,跑分直接把 GPT-4o 和 Claude 给干懵了。 📌 基础参数: • 开源地址:GitHub (bytedance/UI-TARS) • 协议许可:Apache-2.0 • 核心战绩:OSWorld 和 AndroidWorld 多项 Benchmark 登顶 SOTA 🔥 核心杀招: 纯视觉驱动:丢掉繁琐 DOM 树和复杂 API,只看屏幕截图就能精准定位控件、自动跟进。 超越 Claude 3.5:在 OSWorld 电脑端自动化测试中,50 步任务得分 24.6,直接碾压 Anthropic 的 Computer Use。 手机电脑通吃:统一了跨平台的动作空间,无论是 PC 端的复杂软件还是手机 App 都能一键操控。 反思自愈机制:点了没反应或者报错会自动“自我反思”,换个法子继续试,绝不卡死。 🔗 链接:
显示更多
0
23
56
20
转发到社区
OpenAI 今天凌晨公布了全新架构的 GPT-6 Astra 群星 但最让人欣慰的是,人类终于不再卷 coding,去瞄准科学的星辰大海了 OpenAI 内部将其视为第一个 AGI 时代的模型 这个模型在科学研究和抽象推理方面大幅提升 而且这个模型的智力模式非常特别 相比其他模型,可以大幅减少推理步骤,以更少 Token 获得更高智能 但这个模型在 coding 方面却进步很小,不如 Fable 价格方面 10in 50out,也对齐 Fable/Mythos 也许从外界看来,Mythos 可能是第一个 AGI 时代的模型吧,不过我们没资格用 Mythos,无法评价了 科学 Terminal-Bench Science 0.1(科研终端与管线自主操作):从上一代 Sol 的22.4% 暴涨至 64.6%(大幅领先 Fable 5.1 的 52.6%)。 FrontierMath Tier 4 (v2)(前沿科研级数学):达到97.6%。 真实数学发现:协助数学家 Julia Stadlmann 将素数间隔(prime number gaps)上界从 240 推进到 186;推动了一项维持 80 多年未动的数学界限。 智能与效能 动作与步数效率(ARC-AGI-3):在96% 的关卡中,摸索并解出未知机制所用的动作步骤比人类中位数还要少,平均动作数减少 51.7%。它不再靠暴力穷举,而是在上下文里现场发明代数简记法(DSL)压缩状态。 任务级能效比(Cost-per-task):虽然每百万 token 单价更贵,但在 OSWorld 2.0 等长流程复杂任务上,单任务耗时从 75 分钟压到了 40 分钟左右,总消耗 token 显著减少。 工程 专业工业软件(BenchCAD):达到95.9%(领先 Fable 5.1 的 84.3%),直接落地 KiCad(PCB 电路设计)、Unity 3D 排布和金融建模(Financial Modeling World Cup)。 编程 DeepSWE v1.1(真实软件工程能力):Astra 得分为74.1%,对标 Claude Opus 5 的 74.0%、Gemini 3.8 Flash 的 73.7%,甚至低于 Meta Muse Spark 1.3 的 75.4%。基本和大家挤在同一个平台期,完全没有拉开代际差距。 Artificial Analysis (AA) 综合智能与智能体指数:Astra 仅拿到了61.2 分,几乎与上一代 GPT-5.6 Sol(61分左右)持平,在 Coding Agent 指数上未见断层提升。 完整模型介绍在官网,写的非常专业,直接看一首信息,不需要看三方解读,可以在此详细阅读
显示更多
Agent 连续工作几个小时,真正难的是中途失败后,还能准确知道自己做到哪了。 阿里高德团队开源的 LongHorizon-Harness,专门解决长时任务中的状态漂移和错误累积。 它把执行过程拆成 Manage–Execute–Audit 循环: Manager 根据已经验证的进度安排下一步;Executor 在全新上下文中操作桌面、浏览器或命令行;Auditor 再独立检查真实环境。 只有审计确认的结果,才会进入长期任务状态。遇到操作失败、上下文刷新或交付不完整时,Agent 可以保留已完成的部分,从缺口继续推进。 它也不绑定具体模型和后端,可以接入 Claude、GPT、Qwen,以及 Claude Code、Codex CLI、OpenClaw 等工具。 在相同的 Qwen 3.7-Plus 与 Claude Code 配置下,GUI 与 CLI 混合任务通过率从 51.8% 提升到 80.7%;OSWorld 完整完成率从 2.8% 提升到 8.3%;Terminal-Bench 成功率从 69.7% 提升到 77.2%,同时减少了 24% 的 token。 我觉得这篇最有意思的地方在于,它把长时能力的重点,从让一个会话持续运行,推进到了让每段进度都可验证、可恢复,也能可靠地交给下一轮。 模型决定单步能力,harness 决定这些步骤最后能不能拼成一个完整交付。 📎 arxiv:
显示更多