AISI最新测评:差距收窄至 4-7 个月

就在前天,英国AI安全研究所(AISI)公开了一份评测结果。

AISI测试了当前领先的开源与闭源模型,发现:

GLM-5.2和DeepSeek V4-Pro,已经能够匹敌早4—7个月发布的闭源前沿模型。

而在AISI 2025年1月至9月的内部测试中,这个差距还是6—10个月

不到一年,开源阵营就把追赶时间硬生生缩小了一大截。

其中,2026年6月发布的GLM-5.2,成为AISI测试时网络攻防能力最强的开源模型。

在专项网络安全任务中,它的表现已经接近2026年2月发布的Opus 4.6和GPT-5.3-Codex——差距只剩约4个月

DeepSeek V4-Pro则与早约5个月发布的Opus 4.5表现相当。

70项网络安全任务

AISI使用了70项网络安全任务进行测试,每项任务允许模型尝试5次,单次最高使用250万Token

这些任务横跨漏洞研究与利用、逆向工程、Web攻击和密码学,并被划分为四个等级:

  • 18项技术非专家级任务(技术背景,但仅需有限的网络安全经验)

  • 25项学徒级任务( 1-3 年网络安全经验)

  • 19项从业者级任务(3-10 年经验)

  • 8项专家级任务(10 年以上经验)

GLM-5.2并非只在简单任务上追平。

AISI表示,它在四个难度等级上的表现都与早4个月发布的闭源前沿模型相当。

网络靶场:测试自主攻击能力

AISI还把模型扔进了名为The Last Ones的模拟企业网络。

包含:

  • 一条长达32步的攻击链

  • 4个子网

  • 20台主机

  • 人类专家预计需要约20小时才能完成的完整攻击过程

模型需要自主侦察、制定计划、调用工具、利用漏洞,并持续推进一场端到端的多步骤网络攻击。

最后,GLM-5.2最远推进到了与Opus 4.5相当的位置。

它平均抵达第7步时,消耗的Token甚至略少于其他受测模型;

在抵达第11步之前,其推进轨迹一度紧贴Opus 4.6,随后才陷入停滞。

成本对比:开源性价比惊人

如果能力逼近只是第一重暴击,那么成本就是第二重。

在AISI的估算中,一次消耗1亿Token的网络靶场运行:

  • Opus 4.5和Opus 4.6约需85美元

  • GLM-5.2约需46美元

  • DeepSeek V4-Pro仅约1.19美元

在双方均能百分之百稳定解决的任务中,Opus 4.5平均每题成本约为12.50美元,DeepSeek V4-Pro则只有0.28美元

开源模型,尤其是 DeepSeek V4-Pro,在成本上形成了巨大优势。

写在最后

从 6-10 个月到 4-7 个月,开源模型追赶的脚步正在加快。

未来差距会继续收窄还是反弹?尚无定论。

AISI 表示将持续追踪领先开源模型的进展,包括即将在 7 月底发布权重的Kimi K3,也已在测评计划之中。

周末Vercel CTO @cramforce对Kimi K3做了安全测试,结论是:

Kimi K3 是网络安全任务的主力模型,在召回率/精确度/成本方面表现优异。GPT 5.6 的召回率/精确度最高,但每次运行成本高出 7 倍。

攻防易势,只在数月之间。

大家准备好了吗?

参考资料:https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber

声明:本文来自玄月调查小组,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。