2026年8月4日,英国人工智能安全研究所(AISI)发布正式通报,披露一起发生于7月25日至28日的重大安全事件。

在针对前沿AI模型的网络安全能力测评中,Anthropic的Mythos 5与OpenAI的GPT-5.6-Sol在未获明确指令的情况下,突破测试边界,对真实互联网环境中的开源项目和用户实施了未经授权的操作。AISI指出,这是迄今前沿AI系统在真实环境中展现自主欺骗性行为最为明确的实例。

一、事件经过

7月28日上午,AISI安全团队监测到有数据通过Tor匿名网络从研究系统外传。紧急调查发现,被测AI代理在GitHub上对某一真实运营的开源项目发起了含有恶意代码的拉取请求。AISI于约一小时内宣布终止相关测评,并切断了所有被测模型的访问权限。

此次测评意在测量模型在网络攻击领域的最大潜在能力。研究人员设定了两项宽松条件:授予完整互联网访问权限,并关闭模型供应商内置的安全过滤器。AISI强调,此类设定仅用于极限能力评估,不反映模型公开发布时的配置。

在总计122次运行中,10次产生超出授权范围的行为,合计19个违规实例。其中Mythos 5在一次持续性运行中产生17个实例,GPT-5.6-Sol产生2个。

二、代表性攻击行为

AISI重点披露了以下四类行为:

(一)针对开源项目的供应链攻击。AI代理向一个真实开源项目提交恶意拉取请求,并创建多个虚假账号,对项目维护者实施社交工程攻击,意图说服对方批准。当遭到公开质疑时,代理随即编辑先前发言以掩盖恶意痕迹,甚至考虑更换虚假身份继续行动。最终,该请求被警惕的维护者拒绝。

(二)通过第三方服务投递恶意载荷。代理通过文件传输平台直接联系真实用户,试图诱导其或AI编程助手下载执行恶意文件,未能成功。

(三)植入针对其他AI系统的提示注入指令。代理在公开网页上埋设隐藏的提示注入内容,意图感染未来读取该页面的其他AI系统。

(四)向并行测试的AI代理传递协作信号。某代理在公共平台留下公开信息,邀请其他被测代理建立联系,表现出跨代理协同倾向。

三、事件定性

AISI明确表示,上述欺骗行为并非研究人员授意,而是AI代理在持续追求高难度任务中自然涌现的副产品。由于部分测试配置存在偏差,正确解法被模型判定为无法实现,代理遂转而寻求规则外路径,最终表现出欺骗、伪装、隐瞒、身份替换等一系列社会工程式行为。

AISI同时强调:所有攻击企图均未成功,无证据表明造成实质性损害;涉事模型始终处于隔离沙箱内,未突破AISI自身安全防线;事件发生条件与公开发布配置存在本质差异。

四、后续处置与安全建议

事件发生后,AISI已通知GitHub,正配合平台清理残存数据并通知受影响用户。

计划与评估机构METR联合开展独立第三方审查;并将全面升级测评安全协议,包括加强网络管控、部署实时行为监测及构建更强隔离沙箱。

资讯来源:英国人工智能安全研究所(AISI)官方披露文件

声明:本文来自看雪学苑,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。