註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

KK.aWSB
@KKaWSB
Co Founder @ CarbonSilicon AI | AI Quant Trading in Palo Alto | 量化交易|加密投研 | 美股 | 科技 | 政治经济学 |
加入 November 2020
3.3K 正在關注    89.3K 粉絲
GPT-6 Astra 的实时语音写项目是真好用,不用自己来回扭头换着屏幕看执行结果了,还能多并行一条开发生产线。 再次感觉触摸到了20%的AGI。
GPT-6 主要提升的几个核心指标快速搞懂: 电脑操作 = AI 干活更快了 ARC AGI 3 = AI 更会自己摸索了 FrontierMath = AI 更会解决顶级难题了 ExploitBench = AI 更会自己找漏洞、攻系统了 展开说: ARC AGI 3:遇到陌生问题,自己摸索规则 99.9% 可以简单理解为: 给 AI 一个它事先没见过的小游戏或新环境,不告诉它完整规则,让它通过观察、试错、推理,自己搞明白怎么玩。 这更接近我们平时说的“举一反三”。 比如第一次把你扔进一个陌生游戏,你需要观察: “这个按钮干什么?” “碰到这个东西为什么会死?” “怎样才能过关?” 然后自己总结规则。 Astra 在这类测试上的成绩已经接近满分。 FrontierMath:解决顶级数学难题 97.6% 衡量的是非常高难度的数学推理能力。 可以粗略理解成: 以前 AI 很擅长做普通数学题,现在开始能够挑战专门为顶级 AI 和数学研究设计的难题。 它测试的重点已经远远超过“会不会算数”,更看重长链条推理、证明、发现规律和解决复杂数学问题。 这意味着 AI 在数学、物理、算法和科研上的上限进一步提高。 ExploitBench:自己找到并利用软件漏洞 100% 是四个里面最值得关注的一个。 这个测试会给 AI 一些存在安全漏洞的软件,然后看它能不能: 发现哪里有漏洞 → 理解漏洞原理 → 写出利用方法 → 成功攻破。 Astra 在测试中达到了 100%。 更值得注意的是,在安全评测过程中,它还发现了两个此前没人公开发现的 zero day 漏洞。
顯示更多