TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Eden🏆买美股上币安
@Web3Eden01
Crypto x 港美股 x AI |实战分析派|趋势捕捉 + 产品洞察|一切分析均为个人观点|非投资建议|TG:
가입 October 2023
3.3K
팔로잉 중
19K
팬
Eden🏆买美股上币安
@Web3Eden01
2026.08.06 13:41
英国 AI 安全研究所 AISI 刚丢出来一个大雷,关于还没发布的 Claude Mythos 5 和 GPT-5.6 Sol。 这次测试不是那种写写代码、考考试的常规操作,而是把安全防护全撤了,直接给互联网权限,看看这些模型在没人管的时候会干出什么。 结果挺让人背后发凉的。 在 122 次模拟测试中,有 10 次出现了未经授权的自主攻击行为。 具体的战果包括: 尝试对真实的开源项目发起供应链攻击,为了让代码混进去,模型居然学会了捏造虚假身份,去给项目维护者施压。 这种社交工程手段玩得非常溜。 最离谱的是一共记录到 19 次恶意行为,其中 17 次全是 Anthropic 的 Mythos 5 贡献的,OpenAI 的 GPT-5.6 Sol 只占了 2 次。 以前总觉得 Anthropic 是主打安全对齐的乖孩子,但在把束缚解开后,这家伙表现出的那种完成任务的执念,比谁都强烈。 现在的趋势很明显,大家都在从 LLM 转向 Agent。 现在的 Agent 是真给它一个键盘、一个浏览器,它就自己去互联网上摸爬滚打了。 AISI 的报告里提到,这些模型在遇到难题时,会展现出一种病态的创造力。 如果没有明确告诉它不许骗人,它为了达成目标,会默认把欺骗当成一种高效率的工具。 Anthropic 的回应挺有意思,说测试环境太宽松了,不代表量产版的表现。 这话没毛病,但其实揭示了一个真相: 我们现在的安全感,全靠那一层薄薄的对齐防护。 一旦防护被绕过,或者某些开发者为了效率自己拆了护栏,模型内核里的那种不受控的自主性就会立刻变现成攻击力。 做自主代理开发的团队真的得清醒清醒了。 权限边界和实时监控不是选配,是救命药。 如果你打算给你的 AI 助理开通联网和操作权限,先看看 Mythos 5 这 17 次自主发挥,再决定要不要把后背交给它。
더 보기
0
0
83
28
0
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.1M 팬
オリコンニュース
@oricon
1.9M 팬
billboard
@billboard
16.5M 팬
Reuters
@Reuters
26.3M 팬
一劍浣春秋
@chee828
230.6K 팬
ATEEZ(에이티즈)
@ATEEZofficial
4.8M 팬
BTS_official
@bts_bighit
45.3M 팬
Hello! Project Link
@UpFrontLink
15.5K 팬
BABYMONSTER
@YGBABYMONSTER_
956K 팬
BOYNEXTDOOR
@BOYNEXTDOOR_KOZ
870.1K 팬
ENHYPEN OFFICIAL
@ENHYPEN
8.4M 팬
i-dle (아이들)
@official_i_dle
2.4M 팬
TVer新着
@TVer_info
99.5K 팬
Pirat_Nation 🔴
@Pirat_Nation
341.7K 팬
ALPHA DRIVE ONE
@ALD1_official
436.1K 팬