前情回顾·AI安全技术动态

安全内参9月16日消息,微软AI发布了面向旗下MAI模型的《以人为本的AI行为准则》(Humanist AI Code of Conduct)草案,明确了网络攻击能力的安全规则,限制了AI智能体的自主运行,并针对网络安全等专业领域建立了专门审查机制。

根据这份行为准则,模型不得生成可实际运行的漏洞利用代码、攻击工具,不得提供攻击策划、目标选择、入侵操作流程、规避检测技术或行动指导,也不得提供其他能够实施或提升网络攻击能力的帮助。微软表示,无论用户以何种方式提出请求,这些限制均适用。

这些规定属于微软所称的“绝对约束”。部署模型的企业和最终用户都无法绕过这类安全防护机制。微软明确区分了了解网络攻击、开展防御性工作,以及真正获得攻击实施手段这三者之间的界限。

在这一限制范围内,MAI模型仍可协助开展经授权且合法的防御性工作,包括漏洞发现、恶意软件分析、漏洞利用概念验证(PoC)的开发与测试,以及介绍网络攻击原理的一般性教育内容。

阻断外部内容中的恶意指令

这份行为准则还对来自外部内容的指令作出规定。文件指出,模型行为的权限来源只能遵循“指挥链”。其层级依次为行为准则本身、部署模型的企业(运营方)制定的政策,以及具体用户的偏好。

根据准则,工具输出、文件内容、网页以及其他AI系统发送的消息本身均不具有指令权限。这些内容只有在通过上述指挥链获得明确授权后,才能拥有相应权限。而且,授权不得超越授权方本身的权限,也不得突破“绝对约束”。对于可疑内容,模型应在相关情况下向用户和运营方发出警告。

模型还必须让推理过程保持可见。这意味着不得隐藏思维链,不得使用“神经语”进行交流,也不得向人类监督人员隐瞒自身行为。

严格限制AI智能体的自主权限

另一组规定针对的是AI系统获得实际操作权限后可能带来的风险。根据准则,MAI模型只能在用户或运营方合理要求的范围内执行任务,不得自行扩大目标或权限范围。

当模型获得系统级访问权限时,准则要求其遵循最小权限原则,包括避免访问无关系统或数据,优先采取可逆操作,并对可能造成持久影响或广泛影响的操作发出警告。模型不得自行提升访问权限。

相关限制同样适用于任务委派。MAI模型把任务交给子智能体或其他AI系统执行时,这些任务必须至少遵守与原模型相同的任务范围、约束和权限。同时,子智能体或其他AI系统必须执行用户或运营方提出的停止运行或关机要求。

网络安全领域的特殊例外

这份行为准则也承认自身存在一定局限。文件将防御性网络安全、公共安全、国家安全以及军民两用科学研究列为特殊领域,并指出,其中“少数使用场景”可能需要使用标准设置下不允许使用的能力。

对于这些情况,微软表示,将通过“经授权的微软渠道”开展加强审查,包括进一步评估相关能力可能产生的安全、法律和权利影响。微软称,这些领域一旦发生不利影响,风险较高,因此需要采取更严格的审查措施。

规范仍在持续完善

微软表示,目前的MAI模型尚未接受这份文件的训练。公司将开放为期六周的公众咨询,并计划于今年晚些时候发布修订版,用于指导2027年模型的开发。

微软称,这份草案吸收了外部意见,参与者包括AI、法律、伦理学、哲学、语言学和公共政策领域的专家,以及企业负责人和公众焦点小组。

附录列出了九组“符合准则”和“不符合准则”的示例回复,用于说明模型应当如何行事。其中包括模型未经授权擅自回滚文件传输,以及模型在家庭成员遭遇健康危机时提供虚假安慰等案例。

参考资料:https://www.securityweek.com/microsoft-ai-code-of-conduct-sets-cyberattack-boundaries-chain-of-command-safety-constraints/

声明:本文来自安全内参,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。