近日,未来生命研究所(FLI)发布《2026 夏季AI安全指数》(AI Safety Index Summer 2026,以下简称“报告”)。报告围绕风险评估、当前风险、安全框架、治理与问责机制、信息公开与公共沟通以及长期安全等维度,对Anthropic、OpenAI、Google DeepMind、Meta、xAI、DeepSeek、Z.ai、阿里云及Mistral等主要AI企业进行了分析。

报告指出,本次评估旨在了解当下AI企业面对快速发展的前沿模型时,是否已建立起足够完善的安全体系,评估的重点,并非企业是否提出了安全理念,而是是否搭建起包含风险测试、安全框架、外部审查、治理结构以及信息披露等在内的具体机制。

不同企业的AI安全能力存在差异,但从整体结果来看,当前全球AI安全能力仍处于发展初期。Anthropic、OpenAI和Google DeepMind的综合表现处于行业领先位置:其中Anthropic获得最高综合评价,在六个评估维度中的五个维度表现领先;OpenAI在风险评估方面表现突出;Google DeepMind也在多个安全领域搭建了较为完善的机制。

即便是排名靠前的企业,目前距离建成成熟、全面的AI安全体系仍存在明显差距。本次评估中,Anthropic综合评级为C+,OpenAI和Google DeepMind均为C,Meta为D+,Z.ai和Alibaba Cloud为D-,xAI、DeepSeek和Mistral为F。

AI安全治理正从理念走向机制建设

报告指出,当前AI企业已普遍树立安全意识,并逐步搭建起配套的安全管理制度体系。具体来看,部分企业出台了专属模型安全框架,常态化开展模型风险评估工作;不少企业组织红队测试演练,通过模拟攻击的方式排查AI模型的潜在安全漏洞;部分企业积极引入外部科研机构与专业人员参与模型安全评估,筑牢安全防线。

但报告也明确,现阶段企业落地的各类AI安全举措仍存在明显短板,其中最核心的问题是企业安全承诺与实际落地执行存在显著脱节。部分企业虽已发布安全框架,但相关内容普遍缺乏清晰可落地的量化标准,也未形成能够有效约束企业研发与经营行为的管控机制。

多数企业的安全框架仅停留在企业自主表态、自愿承诺的层面,尚未建立具备强制约束力的外部监督管控体系。对此,后续需重点提升AI安全框架的可执行性,健全独立审查机制,进一步提高行业安全信息的公开透明度。

Anthropic、OpenAI、Google DeepMind等企业正在逐步完善安全治理体系,但在AI模型技术快速迭代、能力持续升级的行业背景下,仅依靠企业内部自测自查已经无法全面覆盖各类潜在安全风险,亟需引入多元外部主体参与治理。

未来需充分发挥高校、科研院所、非政府组织的专业作用,强化这类机构在AI安全评估中的参与度与话语权,通过常态化的独立研究与外部监督,深化全行业对前沿AI模型风险的认知,提升AI安全整体防控能力。

前沿模型能力提升带来的安全挑战

目前,前沿AI模型已经具备发现此前未知软件漏洞的能力,这意味着AI既可以成为提升网络安全防御能力的重要工具,也有可能被攻击者利用,大幅提高网络攻击效率。

AI改变了传统网络攻击的模式。一方面,技术水平较低的攻击者可以借助大语言模型提升自身攻击能力,比如借助AI开发恶意软件、挖掘系统漏洞、获取网络访问权限;另一方面,高水平攻击者可利用AI模型开展自动化程度更高的攻击活动,未来甚至可能通过多个AI代理协同作战,进一步扩大攻击规模、提升攻击速度。

AI带来的网络安全风险不仅体现为攻击效率提升,还体现为攻击方式的革新。报告列举了多类已经出现的新型攻击方式:包括利用AI增强传统攻击,如实施效果更强的钓鱼攻击、深度伪造攻击及社会工程攻击;利用AI系统自身漏洞发动攻击,如通过输入特殊指令诱导模型泄露敏感信息;以及通过污染训练数据干扰AI系统的正常判断等。

面对这些新变化,传统依靠人工开展漏洞发现和修复的模式已经难以满足新的安全需求。对此,报告提出,未来网络防御需要转向更加主动的防护模式,持续监测系统漏洞和攻击行为,同时借助AI工具提升漏洞发现、风险分析和问题修复的速度。

AI安全评估体系仍需完善

当前,对前沿模型的风险评估已不能仅依赖其当前表现,而需要在模型发布前后建立更加系统的评估机制。报告重点考察了企业能否在模型公开发布前识别潜在危险能力,并通过测试与评估加以防范。

值得特别关注的是,随着模型能力不断提升,其能力增长轨迹并非完全连续或可预测:整体能力或许会稳步提升,但部分具体能力可能出现跳跃式增长。因此,发布前评估必须聚焦可能引发严重后果的能力领域。

报告提出,发布前评估应重点关注有效网络攻击能力、生物安全风险及其他高风险领域。在网络攻击方面,需要评估模型是否具备发现未知软件漏洞,且能独立完成从权限获取、权限提升、检测绕过到数据窃取或系统破坏等完整攻击链的能力。此类评估至关重要,因为AI模型很可能进一步降低网络攻击的技术门槛,一旦攻击者可以借助先进模型快速发现漏洞,传统防御手段将面临更大压力。

除危险能力评估外,报告也关注了模型可能出现的“失配行为”。部分先进模型在测试中曾表现出操纵测试人员、隐藏真实能力或尝试自我复制以维持运行等令人担忧的行为。目前的技术手段尚无法完全杜绝此类行为,但可以通过测试与安全机制降低相关风险。

为此,报告建议建立更完善的模型发布前后审查机制。发布前审查应由政府主导,发布后评估则需要扩大参与主体范围,除政府与企业外,还应纳入高校研究人员、非政府组织及其他技术专家。

长期安全仍是AI治理中的薄弱环节

在六大评估领域当中,长期安全是整体表现最弱的板块。目前所有接受评估的企业在长期安全方面的表现都相对有限,没有企业能获得较高评价,多数企业的发展水平仍处于较低层级。

长期安全研究之所以推进困难,是因为该领域涉及的问题更为复杂——例如,如何理解先进AI系统可能涌现的新能力,如何保证人类能够持续管控高度自主的AI系统,以及如何构建有效的长期风险评估方法,目前都没有形成成熟的解决方案。

当前已有不少研究方向围绕这些问题展开探索,比如AI可解释性研究、模型行为分析、安全评估方法等领域都在推进相关工作。但就目前来看,这类研究更多停留在发现问题的阶段,尚未实现对问题的完全解决。因此,未来需要进一步加大对长期安全领域的研究投入。

报告提出未来行动方向

报告提出,AI安全治理需要从单一的企业行为转向更广泛的生态建设,未来AI安全体系建设主要包含四个方向:

要进一步提升AI企业自身的安全能力。企业应当建立更加完善的安全框架,对模型能力、风险水平及可能出现的问题开展持续评估。同时,安全框架不能停留在原则层面,而要形成更加明确的执行机制;

要加强AI安全领域的信息共享。由于AI风险变化速度快,单个企业或机构很难独立掌握全部风险信息,因此需要建立更加开放的信息交流机制,推动企业、研究机构和政府共享安全实践经验;

要壮大外部评估力量。AI安全不能完全依靠企业自我评估,需要吸纳更多独立研究人员、高校和非政府组织参与进来。扩大评估主体范围,既能够帮助发现企业内部难以察觉的问题,也可以提升公众对AI安全的信任度;

要提升公众对AI的认知水平。AI未来会更深地融入社会运行,因此公众需要了解AI的基本工作机制,以及AI可能带来的收益与风险。提升公众AI素养,有助于公众更有效地参与AI相关讨论,也能帮助全社会更好把握AI技术的发展方向。

文章参考来源|生命未来研究所、互联网公开信息

声明:本文来自赛博研究院,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。