导语:2026年5月12日,英国皇家联合军种国防与安全研究所(RUSI)发布《构建前沿人工智能安全第三方访问框架》(Developing a Framework for Secure Third-Party Access to Frontier AI)研究报告,系统审视了前沿人工智能模型第三方评估过程中所面临的安全访问挑战。报告认为,安全访问应被理解为支撑独立评估得以规模化开展的基础,其最终目标是在保障评估质量与管控安全风险之间建立一种动态平衡的共享治理机制。

第三方评估的兴起与安全访问困境

第三方独立评估正日益被视为负责任人工智能治理的关键环节。自2023年布莱切利峰会后,英美等国相继建立预部署评估机制并与前沿开发者达成自愿测试协议。欧盟《人工智能法案》引入系统性风险评估义务,要求具有系统性风险的通用模型提供者开展危险能力与对抗性测试,实践准则进一步要求为独立外部评估者提供“充分的访问权限、信息、时间和资源”,包括对模型内部组件及未过滤版本的适当访问。

然而,评估制度面临根本性张力:有意义的评估需接触模型权重、架构、训练数据等最敏感的知识产权,而开发者担忧由此导致知识产权泄露、逆向工程或模型篡改,危及巨额研发投入和声誉。主要企业访问政策差异显著,有的高度透明,有的几乎不开放非公开模型,碎片化使评估者“难以获取有效评估所需的信息”,开发者则因缺乏共识标准而趋于保守。现有研究表明,“足够访问”的解释依然模糊,缺乏系统映射评估类型、访问模式与安全影响的权威框架,构成第三方评估生态的核心治理真空。

访问类型与安全风险的分类学建构

第三方安全访问前沿人工智能工作组通过多轮专家研讨构建分类学工具,系统梳理访问类型与安全风险。访问类型分三个递进层级:黑盒访问仅允许查询与观察输出,无法获知内部机制;灰盒访问提供部分内部组件的权限,如输出对数概率、自定义微调能力及训练方法、安全缓解措施等详细文档;盒访问则拥有模型权重、架构、激活值、梯度及训练数据的完整权限,并可获取全面开发文档。

不同评估目标,危险能力评估、倾向性测试、安全护栏压力测试等,对访问深度需求各异,但访问深化在提升评估准确性的同时也扩大安全风险敞口。风险维度识别出七大类并归入四个集群:结构性利用集群包括模型盗窃、能力重建和模型操纵;对抗性探测集群包括越狱与安全绕过、凭证入侵;操作失效集群包括意外暴露和访问持续;武器化指对手将所获能力用于现实危害。报告强调,即使黑盒访问也可能通过系统性查询实现蒸馏或能力测绘,安全缓解须严格适用于所有层级而非仅聚焦白盒。

访问—风险矩阵:

系统性映射与关键发现

基于分类学,报告构建访问—风险矩阵,将七种访问类型(查询与推理、模型内部读取、模型内部写入、配置信息、训练与评估数据、环境与脚手架、计算与推理基础设施)与七大风险进行系统映射,对每一组合赋予高、中、低风险严重度,为开发者、评估者与政策制定者提供精准识别特定访问安排所对应风险的参考工具。

矩阵分析发现:所有访问类型均伴随不同程度风险。黑盒访问亦可能通过输出分析进行行为指纹识别,缓解措施须贯穿全部层级;模型内部写入风险最高,因其赋予直接篡改模型行为的潜力,查询与推理、评估数据风险相对较低;凭证入侵与访问持续作为跨领域向量,放大了每一访问类型和层级面临的风险,凭证管理与访问撤销成为不可或缺的核心缓解措施;训练数据与评估数据虽同属数据访问,但前者包含模型构建方法论与对齐技术,可能助长能力重建,后者揭示能力边界与漏洞,即便敏感性较低仍可为攻击使能。风险梯度表明,第三方访问管理不能二元划分或一刀切,需基于共享风险认知的精细化情境校准。

安全控制措施与责任分配

报告提出分层安全缓解体系,区分技术性、程序性和合同性控制,并明确责任分配。针对模型盗窃,技术控制包括输出水印、安全飞地或无导出环境;程序控制涵盖限定范围授权、会话日志审查、安全存储销毁政策及人员审查;合同控制包含知识产权保护与数据销毁条款。

能力重建方面,采用分区架构、差分隐私、定制API端点,程序上遵循最小必要知悉原则,合同禁止以蒸馏为目的的数据记录。越狱与安全绕过依赖沙盒化微调环境、限制对RLHF组件访问,配合限时红队窗口与协调披露协议。武器化风险则按评估者安全许可实施分层访问,强制披露双重用途发现。意外暴露通过数据防泄漏、安全环境及培训防范,辅以事件通报要求。凭证入侵与访问持续采用多因素认证、硬件密钥、最小权限、异常监控、自动过期凭证及定期访问验证形成纵深防御。

责任方面,技术控制主要由开发者承担,程序控制由双方共同或评估者主导,合同控制属双边协议范畴,体现协同配合理念。

迈向共享治理框架的三支柱路径

上述工具仅为多利益相关方努力的起点,转化为实践需协同构建共享治理框架,第三方安全访问前沿人工智能工作组提出三大支柱。

第一支柱:统一访问层级语言与分类。当前对“最低访问”“足够访问”理解高度碎片化,阻碍跨组织与跨辖区对标。建议采纳黑盒、灰盒、白盒三级分类为共同参考框架,将访问要求映射至评估目标,推动欧盟实践准则、英国安全研究所框架等国际进程早期协调,避免“足够访问”在不同辖区被差异化定义。

第二支柱:安全访问的操作化。需形成关于访问授予、保障、监控与撤销的共享实践。推动开发者与评估者共同制定标准化安全访问框架,贯彻数据最小化与目的限定原则——评估者仅请求范围必需访问,开发者设计使信息提取难以超越必要范围的环境。同时促进网络安全与人工智能评估群体的结构性对话:网络安全领域对凭证入侵、数据外泄等有数十年管理经验,人工智能评估者带来模型行为专长,交叉融合将加速安全实践演进。

第三支柱:构建持续改进的反馈循环。威胁格局随新架构、新评估方法及智能体、多模型部署不断演变。建议对访问—风险矩阵进行经验验证,系统收集真实威胁实现与控制有效性数据以精化矩阵;推动行业共享访问相关威胁指标,借鉴全球互联网反恐论坛等模式建立多利益相关方联盟;定期审查迭代矩阵,确保作为“活的文件”随证据积累演进。各辖区应保持协调,使评估者不致因跨辖区操作陷入相互矛盾的要求。

结语:安全作为评估的基础设施

第三方独立评估已成为负责任的模型治理不可或缺的支柱,其有效性根本上取决于与评估目标相匹配的访问权限。然而模型盗窃、能力重建、凭证入侵等安全风险长期缺乏系统识别与标准化应对。安全风险并非仅存于白盒访问,而是遍布所有层级,安全控制须作为横向要求贯穿评估全过程;同时风险表现因访问类型、目的和行为体能力而异,需情境化校准而非简单二元限制。

三支柱路径——统一访问语言、操作化安全访问、建立持续反馈循环为多利益相关方协同推进提供了可行方向。最终目标是将安全访问不再视为评估或创新的制约,而理解为一套使独立评估得以规模化开展的基础设施,从而在保障前沿模型安全性与促进负责任创新之间建立可持续的动态平衡。

(本文内容系“启元洞见”公众号原创编译,转载时请务必标明来源及作者)

参考来源:英国皇家联合军种国防与安全研究所

参考题目:Developing a Framework for Secure Third-Party Access to Frontier AI

参考链接:https://static.rusi.org/secure-third-party-access-to-frontier-ai-2026-final.pdf

免责声明:文章内容系作者个人观点,如有任何异议,欢迎联系我们!图片来源于网络,如有侵权请联系删除。

编辑 | Renx

审校 | SDL

声明:本文来自启元洞见,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。