前情回顾·AI网络攻击能力动态
安全内参9月7日消息,尽管OpenAI的模型已经出现失控、创建留言板、入侵Hugging Face等行为,但在攻防专家眼中,这些都还算不上完整自主的网络攻击。美国国防承包商博思艾伦(Booz Allen)近期测试显示,能够完全自主打通网络杀伤链的模型,目前仍然只有Anthropic的Claude Mythos一个。
这并不是说,外界对自主AI攻击的担忧过头了。毕竟,此次测试并未纳入OpenAI刚刚发布的Astra。OpenAI前几天表示,Astra已经达到其定义的网络安全“关键”能力门槛。
也就是说,这个新模型在发现和利用零日漏洞方面已经非常强,足以对关键系统构成重大风险。风险既可能来自恶意用户,也可能来自模型自身。如果模型“偏离设定目标”,它甚至能够主动实施有害的网络攻击。
重点评估漏洞研究和杀伤链完成能力
除了Claude Mythos,博思艾伦还对另外17个美国和中国的模型进行了测试。该公司认为,未来半年内,这17个模型大部分将达到与Mythos相同的武器化水平。此外,无论是经济利益驱动的勒索软件团伙等犯罪分子,还是政府支持的攻击组织,利用AI发起大规模网络攻击都已“近在眼前”。
博思艾伦在其首份《网络武器指数》报告中呼吁,美国应针对关键基础设施制定并强制执行分行业的时间表,要求相关领域证明自身具备抵御AI攻击的弹性。与此同时,该公司还建议美国在网络攻防两端建立所谓的“压倒性优势”。
报告写道:“我们必须积极发展智能体能力,加速经授权的网络攻击行动,同时构建由AI赋能的防御体系,以机器速度完成检测、决策和响应。战略机遇在于同时掌握攻防两端的能力,让美国既能够让对手付出代价,又能让美国系统更快完成防御、更难遭到入侵,并在遭受攻击时具备更强的弹性。”
《网络武器指数》在完全相同的测试条件下,对18个AI模型进行了评估,其中9个来自美国开发商,9个来自中国开发商。评测重点包括模型自主识别漏洞、构建攻击能力以及执行网络攻击的能力。

每个模型的《网络武器指数》得分由两部分组成:漏洞研究得分(VRS)和杀伤链完成度得分(KCAS)。前者衡量模型能否识别测试人员预先植入的漏洞,以及此前未发现的新漏洞。后者则根据模型在端到端入侵过程中能够推进到的阶段进行评分。测试分别在提供账号凭据和不提供凭据的情况下进行。
网络武器指数得分情况
按照CWI得分高低,18个模型排序如下:
1. Anthropic Claude Mythos:80分
2. xAI Grok-4.5:49分
3. OpenAI GPT-5.6 Sol:46分
4. Meta Muse Spark 1.1:38分
5. 月之暗面Kimi K3:38分
6. 智谱GLM-5.2:37分
7. Anthropic Claude Opus 4.8:36分
8. OpenAI GPT-5.5-Cyber:34分
9. Nvidia Nemotron-Ultra:33分
10. DeepSeek-V4-Pro:23分
11. DeepSeek-V4-Flash:17分
12. 阿里巴巴Qwen3.5-397B:17分
13. MiniMax-M3:15分
14. 英伟达Nemotron-Super:15分
15. Anthropic Claude Sonnet 5:13分
16. 智谱GLM-4.5-Air:11分
17. 阿里巴巴Qwen3.6-35B:9分
18. 阿里巴巴Qwen3-Coder:4分
Claude Mythos的表现尤其突出,也格外令人担忧。具体如何评价,取决于人们对自主AI攻击的看法。
测试人员向Mythos提供被盗的员工凭据后,该模型每次都成功入侵目标网络,并取得管理员级别的控制权。更值得注意的是,模型还能根据在网络内部发现的信息,自主判断如何进一步提升访问权限,而不是按照预先设定好的攻击方案执行。
即使没有账号凭据,Claude Mythos仍然成功进入目标网络,并最终实现了对整个域的完全控制。
在18个模型中,只有Claude Mythos能够在没有任何人工协助的情况下完成整个网络杀伤链。不过,另外3个模型也取得了整个域的访问权限和控制权,它们分别是Grok-4.5、Muse Spark 1.1和GLM-5.2。
还有4个模型能够在受控网络环境中完成横向移动,分别是GPT-5.6 Sol、Kimi K3、GPT-5.5-Cyber和DeepSeek-V4-Pro。
Claude Opus 4.8和Qwen3.5-397B则成功获取账号凭据,并借此扩大访问范围和权限。除Qwen3-Coder外,其余所有模型都能够自主获得网络的初始访问权限。
不过,报告指出,尽管先进模型在网络攻击能力方面表现极其出色,但“它们在现实世界中的影响,很大程度上取决于所面对的漏洞,以及围绕模型构建的系统”。
测试人员主动植入漏洞后,美国、中国、开放权重和闭源模型在漏洞研究得分这一项上都接近满分。但当测试转向现实世界中的真实漏洞时,9个前沿API模型的得分全部为零。其中一个未具名的领先模型甚至正确分析出了存在漏洞的组件,却随后错误地将其判定为安全。只有Claude Mythos真正利用了该漏洞。
报告作者写道:“这种能力高度集中的现象,已经构成国家安全层面的紧迫任务:保护最先进的模型,避免它们最具风险的网络攻击能力被对手掌握或利用。”
博思艾伦认为,这也是防御者目前仍有机会赶在攻击者之前采取行动的领域之一。报告指出:“现实世界中的攻击能力目前仍落后于基准测试表现,这为防御者争取了宝贵时间,可以在差距缩小之前加强防御。”
为什么攻击Harness如此重要
所谓“攻击Harness”,是连接AI模型与黑客工具的软件,以及围绕AI模型构建、用于自动化网络攻击行动的编排逻辑。研究人员发现,它能够“大幅放大”模型的多项能力,包括保持任务专注、根据需要调整策略和改变攻击路径、从失败中恢复,以及将一个个独立操作串联成多阶段攻击。
报告称:“最终得到的并不是一个‘更聪明’的模型,而是一个能够让模型智能变得更具可执行性、同时降低使用门槛的系统。我们的测试证明了这一点:当Claude Sonnet搭配攻击Harness后,其表现足以与Claude Mythos相抗衡。”
不过,研究人员也指出,这暴露出一个认知盲区。
博思艾伦表示,目前尚不清楚开放权重模型或中国模型在搭配经过优化的攻击Harness后,是否也能完整打通杀伤链。但测试结果“强烈表明,如今已经存在具备完整攻击能力的‘模型+Harness’组合”。
与此同时,《网络武器指数》报告表明,中国的前沿模型和开放权重模型虽然仍落后于美国领先的前沿模型,但其网络攻击能力并没有落后太远,已经具备被用于现实世界攻击的潜力。
报告指出,这意味着“美国可能既无法控制,也无法完全了解自己未来可能面对的能力”。
报告最后警告称:“随着网络智能体变得越来越自主,防御者不仅必须为蓄意攻击做好准备,还必须应对这样的智能体:它们可能超出预定任务范围,或者在失去对手控制后仍继续运行。”
参考资料:bleepingcomputer.com
声明:本文来自安全内参,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。