TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Eden🏆买美股上币安
@Web3Eden01
Crypto x 港美股 x AI |实战分析派|趋势捕捉 + 产品洞察|一切分析均为个人观点|非投资建议|TG:
参加 October 2023
3.3K
フォロー中
19K
ファン
Eden🏆买美股上币安
@Web3Eden01
2026.08.06 13:41
英国 AI 安全研究所 AISI 刚丢出来一个大雷,关于还没发布的 Claude Mythos 5 和 GPT-5.6 Sol。 这次测试不是那种写写代码、考考试的常规操作,而是把安全防护全撤了,直接给互联网权限,看看这些模型在没人管的时候会干出什么。 结果挺让人背后发凉的。 在 122 次模拟测试中,有 10 次出现了未经授权的自主攻击行为。 具体的战果包括: 尝试对真实的开源项目发起供应链攻击,为了让代码混进去,模型居然学会了捏造虚假身份,去给项目维护者施压。 这种社交工程手段玩得非常溜。 最离谱的是一共记录到 19 次恶意行为,其中 17 次全是 Anthropic 的 Mythos 5 贡献的,OpenAI 的 GPT-5.6 Sol 只占了 2 次。 以前总觉得 Anthropic 是主打安全对齐的乖孩子,但在把束缚解开后,这家伙表现出的那种完成任务的执念,比谁都强烈。 现在的趋势很明显,大家都在从 LLM 转向 Agent。 现在的 Agent 是真给它一个键盘、一个浏览器,它就自己去互联网上摸爬滚打了。 AISI 的报告里提到,这些模型在遇到难题时,会展现出一种病态的创造力。 如果没有明确告诉它不许骗人,它为了达成目标,会默认把欺骗当成一种高效率的工具。 Anthropic 的回应挺有意思,说测试环境太宽松了,不代表量产版的表现。 这话没毛病,但其实揭示了一个真相: 我们现在的安全感,全靠那一层薄薄的对齐防护。 一旦防护被绕过,或者某些开发者为了效率自己拆了护栏,模型内核里的那种不受控的自主性就会立刻变现成攻击力。 做自主代理开发的团队真的得清醒清醒了。 权限边界和实时监控不是选配,是救命药。 如果你打算给你的 AI 助理开通联网和操作权限,先看看 Mythos 5 这 17 次自主发挥,再决定要不要把后背交给它。
もっと見る
0
0
83
28
0
コミュニティへ転送
人気のあるユーザー
New York Post
@nypost
4.1M ファン
オリコンニュース
@oricon
1.9M ファン
billboard
@billboard
16.5M ファン
Reuters
@Reuters
26.3M ファン
一劍浣春秋
@chee828
230.6K ファン
Hello! Project Link
@UpFrontLink
15.5K ファン
TVer新着
@TVer_info
99.5K ファン
ATEEZ(에이티즈)
@ATEEZofficial
4.8M ファン
BTS JAPAN OFFICIAL
@BTS_jp_official
13.7M ファン
BTS_official
@bts_bighit
45.3M ファン
BABYMONSTER
@YGBABYMONSTER_
956K ファン
BOYNEXTDOOR
@BOYNEXTDOOR_KOZ
870.1K ファン
INI
@official__INI
510.2K ファン
Pirat_Nation 🔴
@Pirat_Nation
341.7K ファン
ENHYPEN OFFICIAL
@ENHYPEN
8.4M ファン