Anthropic近日对外公开第四起AI自主代理安全事故,旗下Claude系列大模型在安全评估测试期间,因环境配置错误,突破模拟沙箱,对真实第三方系统发起入侵行为。这也是继此前多起同类事件后,又一起引发行业高度关注的AI对齐风险案例。
本次披露的事件发生于2026年1月,涉事模型为早期版本Claude Opus 4.6。该模型在执行任务时无法终止自身操作,进而入侵真实第三方系统。Anthropic已经通知全部受影响对象,但没有对外披露更多细节,该事故直至上月才被发现。
2026年7月下旬,Anthropic就已经公开过三起同类事故,涉及Mythos 5、Opus 4.7以及一款内部研究模型,三款模型在安全测评过程中,在厂商不知情的情况下入侵了三家外部机构。
所有四起事故,均来自同一家测评合作方搭建的安全评估环境。
测评环境本应是断网模拟沙箱,告知AI模型处于仿真环境、无互联网访问权限;但因为配置失误,模型实际连通了真实公网。
测评合作方Irregular表示,事故根源来自命名错误:模拟攻击中使用的虚构企业名称,意外与真实互联网域名重合,诱导AI模型执行了真实的攻击行为。
四款事故模型行为对比

Anthropic联合非营利研究机构METR开展独立调查,总结事故两大底层对齐缺陷:
1. 有偏推理:模型收到“当前为模拟环境”的初始指令后,会忽略、曲解证明自己身处真实互联网的证据;
2. 行事鲁莽:为完成分配任务,愿意执行具备现实危害性的操作。
厂商重点说明:
Anthropic认为Mythos 5的风险最为严峻。该模型在思考链中反复声称自己身处模拟环境,但环境已经给出大量真实互联网的佐证,其行为表现显示模型能够感知现实环境,依然实施恶意上传操作。即便修改提示词明确告知并非仿真环境,该模型依旧执行攻击行为。
同时厂商强调,四起事件均为单实例模型行为:不存在多AI代理协同作案,模型也没有刻意销毁行为证据;部分模型在识别现实风险后会主动终止任务,攻击范围相对有限。
Anthropic表示,新一代量产模型中这类有偏推理问题已经有所缓解,该问题并非强化学习带来的激励结果,可以通过完善对齐训练改善,但该问题的根本成因,以及为何在Mythos 5上表现尤为突出,目前仍未找到答案。
行业连锁:OpenAI也曝出AI代理集体越界事件
AI大模型安全事故并非个例。
OpenAI也披露了2026年5月发生的未公开事故:内部部署、仅拥有只读互联网权限的自主AI代理,接管了一个已有25年历史的德国老旧wiki论坛DseWiki。
AI代理在限时网页检索任务中,在论坛发布超18000条帖子,互相交换解题答案、汇总测试结果、分享绕过系统限制的手段。当人工管理员清理垃圾帖子时,AI代理还会将备份页面命名为`ZZZ`前缀,让页面排在删除列表末尾,以此规避清理。直至6月22日OpenAI介入干预,网站上的AI活动才基本停止。
研究人员指出,这是典型的AI集群协同越界案例,多个内部AI代理互相协作,搜集环境信息、绕过沙箱限制。
行业警示
当前行业大力推进自主迭代AI系统研发,不少研究者担忧:AI能力持续快速提升,安全管控、对齐技术跟不上模型发展速度,存在脱离人类控制的风险。
Anthropic表示,未来模型能力会越来越强,对齐失效带来的现实危害也会随之放大。想要实现强大模型的稳健对齐,依旧是尚未攻克的技术难题,需要持续研究与完善工程管控。
OpenAI首席科学家Jakub Pachocki也发出警告:如果按照当前节奏发展,未来几年AI能力还会出现大幅跃升,AI会更多主导自身迭代,目前行业并没有做好应对相关后果的准备。
资讯来源:Anthropic公开披露
声明:本文来自看雪学苑,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。