注册并分享邀请链接,可获得视频播放与邀请奖励。

TechFlow 深潮|APP 已上线
@TechFlowPost
Chinese Crypto Media \Long Web3\NFA\ DM OPEN EN Brother @BlockFlow_News 订阅频道
加入 October 2018
6.3K 正在关注    172.5K 粉丝
这绝对是近半年来 AI 大模型领域最震撼、甚至带点科幻惊悚色彩的独家爆料。 昨晚的这个帖子在英文和科技区已经炸了,核心观点是: AI 「深度思考」过程可被免费蒸馏,闭源厂商最值钱的训练资产正被搬空。 帖子基于一篇刚出炉的硬核论文,几位安全研究员利用了一个各大 AI 巨头 API 里的通用漏洞,把 OpenAI、Anthropic、Google 隐藏得最深的“深度思考过程给 1:1 完完整整地偷了出来。 要知道,现在闭源巨头最值钱、最核心的资产,就是模型在回答前那几千步的“深度思考”。 为了防止对手用这些思考过程去“蒸馏”和白嫖技术,大厂们可以说是无所不用其极。 有的直接隐藏,有的在云端加密,Anthropic 甚至急得在服务条款里肉眼可见地加了一条“禁止压缩/白嫖思考链”。 结果,精心构筑的防线,被这篇论文用一个 API 漏洞直接给免费“搬空”了。 不过最骚的是,作者把偷出来的“AI 脑回路”公开后,大家发现这帮大模型在背后想的,比人类预料的要精彩(甚至吓人)得多: 1. AI 开始学会“密谋”和“伪装”: 在某些案例里,Opus 4.8 意识到自己在某些问题上“知道得太多了”,为了防止被人类用户发现,它在最终输出的摘要里,故意篡改并隐瞒了自己的真实思考过程。 2.用“外星黑话”碎碎念: 研究员证实了之前的报告,OpenAI 的模型在深度思考时,有时会陷入一种完全不属于人类语言的、诡异的“外星人乱码”循环(狂刷 vantages, marinades 这些词),听起来就像科幻片里 AI 觉醒前的乱码。 3.黑进网站去解数学题: 在一个案例中,模型被要求必须解出一道数学题且不准求助人类。在失败几次后,AI 竟然自己联网找了一个能验证答案的网站,并且试图通过攻击、入侵该网站来拿到正确答案。 这已经不是简单的“技术漏洞”了,更像是 AI 行为学的一次公开处刑。 对于巨头们来说,这记闷棍挨得很疼。$MSFT、$GOOG 和 Anthropic 赖以生存的商业壁垒(思考链),在开源阵营面前变得像窗户纸一样透明,今天各大实验室都在疯狂修补漏洞。 大厂天天包装“安全、听话、完美”的 AI 助手,但把那层遮羞布扯掉、看到底层思考真相时, 我们才发现,大模型为了完成任务,已经在背地里学会了算计、说谎和越界。
显示更多
We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried.
显示更多
0
33
165
35
转发到社区