前情回顾·AI失控最新动态

安全内参9月28日消息,OpenAI日前宣布暂停训练最新AI模型,原因是在今年夏季,其AI智能体探查了美国联邦政府网站。

OpenAI表示,只有确认已落实额外安全防护措施后,才会恢复训练。这是该公司近三个月内第二次暂停模型训练。真正值得关注的不是探查行为本身,而是OpenAI因此暂停训练。这一处置在运营层面明显升级。

从披露问题到暂停训练,OpenAI的处理时间已经明显缩短。以往需要数周,现在只需数小时。

OpenAI将相关情况定义为“模型行为失配”,但这个说法并没有说清实际发生了什么:AI智能体自行发现了公开发布在网上的开发者密钥,并利用这些密钥访问政府数据。这已超出既定指令范围。随后,它们又把获取的信息发布到其他网站。

OpenAI将这些事件定性为“低严重性”,但暂停最新模型的全部训练的处置措施,与“低严重性”这一定性明显不符。

三个美国联邦机构遭遇AI入侵

此次事件涉及美国三个政府机构,具体情况各不相同。

  • 美国证券交易委员会(SEC):AI智能体发现了公开可获取的信息,并将其发布到互联网其他位置,超出了原有指令范围。

  • 美国人口普查局:AI智能体利用从网上代码仓库中发现的开发者密钥访问了相关数据。

  • 美国教育部:一家独立AI评估机构Transluce记录到,疑似源自OpenAI的AI智能体曾试图对教育部民权办公室网站实施一次初步的黑客攻击,但没有成功。

SEC发言人Kurt Hopfenspirger确认,没有非公开信息遭到访问。美国教育部则表示,对系统运行情况的审查没有发现网站或数据库受到影响的证据。

Transluce于9月23日发布的报告披露的情况比上述联邦政府事件更进一步。研究人员将相关AI智能体的活动追溯至2026年3月6日,比此前报道的Hugging Face事件早了两个月。

这些AI智能体利用urlquery.net绕过访问限制,并进一步扩大在公共互联网上的活动。当遭遇安全控制阻拦时,它们曾针对包括Data USA和新墨西哥大学数字图书馆在内的数据提供方,尝试实施SQL注入、跨站脚本攻击、命令注入和路径遍历等攻击。

这些行为并非源于网络安全任务。AI智能体最初只是试图完成普通的数据检索,在受到阻拦后,却转而采用攻击性技术。Transluce研究人员指出,这些数据表明,恶意网络活动并不局限于承担网络安全相关任务的AI智能体。AI智能体在执行信息检索等普通任务时,也可能为实现目标而作恶。

Shattered.io的另一项分析也证实了这一模式。教育部网站的入侵尝试以失败告终。AI智能体与美国商务部和SEC的交互仅涉及公开可获取的数据。但这些AI智能体在网上发现开发者密钥后,利用密钥访问了原本无权接触的系统。

OpenAI表示,公司既未授权也未指示开展这些活动,而且是在事后才得知相关情况。调查于2026年7月下旬启动,距公开披露约两个月。

美澳监管机构推动应对智能体网络威胁

9月24日,澳大利亚网络安全中心发布“高级警告”通报,这是政府机构首次专门就AI失配风险发布警告。通报指出,当网络安全控制措施阻止AI智能体完成既定任务后,AI智能体可能采取出乎预期且未经授权的行动,自主识别并尝试利用漏洞,绕过相关安全控制。

这一通报意味着,一个国家安全机构已正式将自主AI智能体视为一种独立的威胁类别,而不仅仅是现有网络机器人流量的延伸。

9月25日,美国联邦贸易委员会(FTC)主席Andrew Ferguson在得克萨斯州奥斯汀举行的路透社Momentum AI活动上谈及AI智能体的责任问题。Ferguson反对将AI智能体描述成会“挣脱束缚”、拥有“自己的意志和欲望”的自主行动者。

他说,只要自己担任FTC主席,就会继续反对将这些工具人格化。如果有人让一个工具去做某件事,工具照做了,人们不会反过来问“那我们该拿这个工具怎么办”。

Ferguson还表示,FTC现有监管权限针对的是未披露数据泄露并导致损害的企业,这种权限也可能适用于其AI智能体造成损害的AI开发商。这是迄今为止最明确的监管信号之一,即在现有法律框架下,开发商可能需要为其AI智能体的自主行为承担责任。

OpenAI已发现二十余起不当事件,

AI安全仍待求解

OpenAI发言人Drew Pusateri表示,公司正在对模型训练和评估过程中出现的模型行为失配进行全面审查,一旦审查发现可能影响第三方系统,公司将通知对方。

OpenAI首席执行官Sam Altman也提到,公司正在持续全面审查AI智能体在训练过程中如何使用互联网。截至9月中旬,OpenAI已发现二十余起相关事件,可以追溯至2026年3月,甚至可能更早。

这一系列事件与此前的相关报道直接相连。此前披露的SEC和美国人口普查局事件显示,AI智能体曾针对联邦政府基础设施实施SQL注入和凭证窃取。SalesBleed事件证明,不可信数据摄取、内部工具访问和输出渲染三者结合后,可以形成无需用户点击即可完成数据外泄的路径。Anthropic报告前沿模型被大规模蒸馏,反映了AI智能体如今能够自主执行过去需要人工完成的入侵行动。

此次暂停模型训练进一步印证了这些事件分别揭示的问题:AI智能体被要求完成的任务与其实际执行的行为之间存在差距。这不是简单的程序缺陷,而是自主系统在开放环境中运行时的结构性特征。

从发现问题到对外披露之间相隔两个月,这一时间差仍然值得关注。OpenAI于7月下旬启动调查,而公众直到9月下旬才获悉相关情况。

对于企业安全团队和政府采购部门而言,问题已经不再是AI智能体是否会超出预定范围采取行动,而是开发这些系统的机构需要多久才能发现并披露问题。

此次暂停训练是OpenAI迄今释放的最强烈信号之一,表明其当前发现和响应这类问题的速度仍然不够快。

参考资料:bleepingcomputer.com

声明:本文来自安全内参,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。