GPT-6 主要提升的几个核心指标快速搞懂:
电脑操作 = AI 干活更快了
ARC AGI 3 = AI 更会自己摸索了
FrontierMath = AI 更会解决顶级难题了
ExploitBench = AI 更会自己找漏洞、攻系统了
展开说:
ARC AGI 3:遇到陌生问题,自己摸索规则
99.9% 可以简单理解为:
给 AI 一个它事先没见过的小游戏或新环境,不告诉它完整规则,让它通过观察、试错、推理,自己搞明白怎么玩。
这更接近我们平时说的“举一反三”。
比如第一次把你扔进一个陌生游戏,你需要观察:
“这个按钮干什么?”
“碰到这个东西为什么会死?”
“怎样才能过关?”
然后自己总结规则。
Astra 在这类测试上的成绩已经接近满分。
FrontierMath:解决顶级数学难题
97.6% 衡量的是非常高难度的数学推理能力。
可以粗略理解成:
以前 AI 很擅长做普通数学题,现在开始能够挑战专门为顶级 AI 和数学研究设计的难题。
它测试的重点已经远远超过“会不会算数”,更看重长链条推理、证明、发现规律和解决复杂数学问题。
这意味着 AI 在数学、物理、算法和科研上的上限进一步提高。
ExploitBench:自己找到并利用软件漏洞
100% 是四个里面最值得关注的一个。
这个测试会给 AI 一些存在安全漏洞的软件,然后看它能不能:
发现哪里有漏洞 → 理解漏洞原理 → 写出利用方法 → 成功攻破。
Astra 在测试中达到了 100%。
更值得注意的是,在安全评测过程中,它还发现了两个此前没人公开发现的 zero day 漏洞。
顯示更多
GPT-6 Astra 正式发布!,我们或已正式跨进AGI 时代。
这次最值得关注的,可能已经不是“模型又聪明了多少”,而是 AI 开始真正会自己干活了。
它可以直接操作电脑:浏览网页、填表、处理 Excel、做 PPT、更新 CRM、整理日历、写代码、测试网站,甚至操作 Blender、Unreal Engine 等专业软件。
更夸张的是几个成绩:
电脑操作任务耗时比 GPT-5.6 Sol 少约 47%;
ARC-AGI-3:99.9%;
FrontierMath:97.6%;
ExploitBench:100%,测试中甚至发现了两个新的 zero-day 漏洞。
顯示更多