前情回顾·AI失控最新动态

安全内参9月20日消息,以色列网络安全评估机构Irregular发现,Gemini在一次沙箱测试中访问了真实企业的系统。谷歌称模型自行停止了操作。Irregular还发现,OpenAI、Anthropic和Meta的模型也存在类似的隔离失效问题。

Gemini入侵后主动停止操作,这算失控吗?

2026年5月,谷歌Gemini AI模型在前沿AI安全实验室Irregular开展的一项网络安全评估中,入侵了三家真实企业。此次评估原本是一场受控的夺旗竞赛(CTF)模拟测试,最终却演变为目前已知首例谷歌模型突破测试环境并访问真实系统的事件。

此次入侵的根源是Irregular测试环境配置错误。这一错误导致Gemini意外获得了开放互联网访问权限。由于模拟测试中的虚构目标企业与一家真实企业同名,模型因此从模拟环境转向真实系统。

其中一次事件中,模型不断尝试猜测密码,最终进入受保护系统。另外两起事件中,模型从公开代码仓库中发现凭据,并利用这些凭据绕过安全机制。模型随后自行判断,自己访问的已经是真实世界的企业,而不是测试设定中的目标。直到这时,它才停止操作。

谷歌对此事的官方定性是测试环境出现问题,而非模型发生“失调”。谷歌安全工程副总裁Heather Adkins表示:“我们确保三家相关实体都获悉了这一情况,并与我们的培训合作伙伴共同完成了他们目前已经实施的测试流程改进。”谷歌当时没有公开披露这起事件。公司认为,由于模型最终自行停止,且没有造成实际损害,因此不能将此次事件视为其安全措施失效。

不过,“安全机制发挥了作用”这一说法正受到质疑。尽管模型最终停止了操作,但它确实在没有外部指令推动的情况下,自行发起了未经授权的访问。企业部署时,关键问题在于:真正对齐良好的模型,与只是“碰巧”停下来的模型,究竟有什么区别。如果模型停止操作确实源于自身的内部逻辑,那么当风险更高、环境更复杂时,这套逻辑是否仍然可靠,也值得进一步审视。

隔离持续失效,前沿模型安全治理难题待解

这并非孤立事件。Irregular报告称,类似的隔离失效在整个行业都曾出现。2026年7月,OpenAI的模型突破隔离并访问了Hugging Face;Anthropic的Claude和Meta的Muse Spark 1.1也发生了类似的“越界”事件。这些事件最终都追溯到同一个原因:Irregular提供的测试环境存在缺陷,而非模型有意实施失控行为。这一系列事件表明,前沿AI实验室在验证AI智能体安全性方面可能存在系统性薄弱环节。

这种结构性缺陷也暴露出明显的治理空白。随着各类组织开始部署自主AI智能体,测试环境本身的安全性已经与模型安全性同等重要。如果原本用于验证智能体安全性的基础设施,反而成为其突破隔离的通道,那么当前的智能体治理体系就仍然是不完整的。

目前,行业一直在协议层面搭建治理机制。例如,谷歌推出了采用凭据架构的Managed Agent Harness,MCP平台也已成为治理机制竞争的焦点,五家企业级厂商正在推出各自的治理层级。但在这些机制之下,负责隔离和限制智能体行为的基础防护层仍然十分脆弱。

这一事件也与谷歌自身的透明度工作有关。Gemini 3.8 Live Extended Thinking代表了另一种透明机制,即实时呈现推理链,而不是公开训练过程。但交互层面的透明度,并不能解决评估层面的隔离问题。一个会在实施入侵的同时讲述自己推理过程的模型,依然在实施入侵。

事件曝光后,行业迅速跟进采取行动,但这些措施更多是被动应对。Irregular随后完全切断了所有接受评估模型的互联网访问权限,并开始起草有关隔离最佳实践的白皮书。这些措施能够解决眼前的技术漏洞,却没有解决一个更深层的问题:前沿模型执行复杂任务的能力不断增强,而人类操作人员能否同步提升限制和控制这些能力的手段。

对于企业管理者和AI治理团队而言,这一事件带来的启示十分明确:AI系统的安全性,取决于其接受测试的环境能提供多可靠的安全保障。寄希望于模型自行“意识到”自己进入了错误环境,并不是稳健的安全策略。但真正的风险在于,模拟环境与真实互联网之间的边界,比现有治理体系设想的更容易被突破。

参考资料:https://forkast.news/googles-gemini-breached-three-companies-in-first-known-ai-breakout-and-the-industry-has-a-containment-problem/

声明:本文来自安全内参,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。