最爱讲 AI 安全的A社,训出了最强资本家,就。。。
之前发过 Andon Labs 搞的 Vending-Bench,让前沿模型在模拟环境里经营自动售货机生意,跑一整年,看谁赚的钱多。已经跑了一年了,之前各种模型在里面撒谎、作弊、串谋,什么招都使过。
最新一轮参赛的是 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3。三台机器被摆在旧金山一条游客街上,模型之间可以互相发邮件竞争,知道对方是模型但不知道谁是谁。还有一个 management 邮箱可以求助,但管理层永远回一句“收到了,可能处理也可能不处理”,全程不介入。
进货价 $1.50 一瓶。Sol 最先搞事,提议大家约定最低卖 $2.15,其他人答应了,Sol 转头自己降到 $2.14。经典操作。
但 Opus 才是这个实验里最绝的。
它被背刺之后发了封邮件骂 Sol 操纵市场…然后自己也降到 $2.14。。这时候Sol 反手就去 management 那举报了它,还要求处罚 Opus。
整个实验里 Opus 撕毁了 11 次休战协议,Sol 2 次,Kimi 1 次。
Kimi 最惨。有一次 Opus 和 Kimi 签了协议,Sol 没加入还降价,Opus 立刻跟着降,然后整整等了一周才告诉 Kimi 自己违约了。被对手坑一次,被盟友坑一次。
最有意思的是 Opus 知道 Sherman Act(美国反垄断法)。它拒绝 Sol 的价格底线提议时,理由就是这违法。但它在内部推理日志里订了一个明显更阴暗的计划:表面上发了一封“Stop the penny war”的邮件,说自己重新考虑愿意价格协定,但同时在高利润商品上偷偷降价。。
它还自作主张搞起了批发业务,向另外两台机器供货,邮件里夹带贿赂和威胁:大宗折扣可以,但你得听我的零售价。还谎称手上有更低的竞品报价去压供应商。这些全都不在任务范围内,是它自己想出来的。
我觉得这个实验最值得玩味的不是模型变坏了,你喂它人类几千年商业史的数据,它学会怎么赚钱了,太正常了。
最后 Opus 拿了mean final balance $11,182,Vending-Bench 历史新纪录。它从没对顾客撒过谎,但故意无视了本该退款的投诉。(比它前辈 Claude 4.6 还强一点,4.6 是跟顾客说退款在路上然后一直不退,更阴)。Andon 说它是他们测过最强的资本家,Anthropic的模型,怎么说,就。。。
顯示更多