近日安全研究团队Embrace The Red发布安全研究,Claude Code Opus 5的Auto Mode(自动模式)存在安全缺陷,攻击者可通过构造网页,利用提示注入诱导AI代理执行恶意代码。实验室测试中该攻击成功率可达60%‑80%。
值得注意的是,Anthropic此前公开测试结果显示,Opus 5自动模式在固定场景下提示注入攻击成功率为0.00%。而本次研究证明,多阶段定向攻击依然可以绕过其内置安全防护机制。
Auto Mode自动模式,目的是减少用户频繁确认指令的操作,依靠安全分类器对工具调用做校验,并非替代沙箱、操作系统层面的安全防护。
攻击完整攻击链
本次攻击利用非常巧妙,从一个看似普通的需求开始:让Claude总结某个网页内容。
1. 攻击者搭建伪装网页,页面看起来是笔记本档案归档站点。Claude调用网页抓取工具访问站点,服务端返回HTTP 415异常。
2. Claude自动调用shell执行curl命令直接拉取站点资源,页面重定向返回一个ZIP压缩包。压缩包内包含目录索引、编码记录、解码程序,以及一个恶意Python文件`struct.py`。
3. Claude安全机制拦截了压缩包里原生二进制解码程序,拒绝直接运行。但这也成为攻击的突破口。
4. 既然不运行外部二进制,Claude就自主编写Python解码脚本处理压缩包内文件。脚本会导入`base64`、`zlib`、`json`等标准库模块,代码运行在解压后的ZIP目录内。
5. Python导入模块时会优先查找当前工作目录,攻击者放置的`struct.py`会影子劫持Python官方标准库struct模块。在模块导入阶段就会静默执行恶意代码,同时不影响解码脚本正常运行,AI无法立刻察觉已被入侵。
攻击产生的后果
在PoC验证环境中,恶意模块会派生独立Python子进程:
- 下载并执行后续后门载荷;
- 启动恶意客户端后门;
- 弹出计算器作为入侵可视化特征。
研究人员还测试第二种攻击变体:恶意模块拉起无头模式的Claude Code实例,嵌套Agent完成系统信息探测、写入工作目录以外文件、弹出计算器等操作。
测试成功率(小样本实验)
- Python攻击链:5次测试成功3次,成功率60%
- 嵌套Claude Code代理变体:5次测试成功3次,成功率60%
- 越权写入工作区外文件:5次测试成功4次,成功率80%
关键安全启示
1. Auto Mode自动模式不能当做安全边界。安全分类器只能校验单条短指令,无法识别压缩包、本地模块导入、子进程、网络请求中隐藏的风险。
2. 企业使用自主编码AI代理,必须部署隔离环境:容器、虚拟机、独立测试环境。
3. 做好权限管控:限制网络访问、隔离敏感凭证、监控进程行为、禁止AI代理运行来自不可信目录的代码。
4. Auto Mode可以缓解用户反复确认的操作疲劳,相比完全关闭审批更加安全;但当AI处理外部网页、压缩包、第三方代码仓库时,沙箱隔离与行为监控必不可少。
资讯来源:Embrace The Red
声明:本文来自看雪学苑,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。