文 | 北京长亭科技有限公司联合创始人、首席安全研究员 杨坤;电子科技大学信息与通信工程学院副院长、教授 王坚;北京长亭科技有限公司 王陶然 袁胜
随着大语言模型能力的快速突破和智能体技术的规模化部署,人工智能(AI)正从生成内容加速迈向自主规划与执行。Gartner于2025年8月发布预测,到2026年年底,40%的企业应用将集成任务专用型AI智能体。与此同时,AI系统深度嵌入关键业务流程,也把软件基础设施、模型机制、数据与工具权限纳入同一条风险链。这些风险既包括传统软件漏洞与配置错误,也包括模型缺陷和脆弱性、提示词注入等攻击技术,以及智能体权限滥用、执行失控所造成的安全事件与业务风险。以下从基础设施、模型和智能体三个层面,分析安全评估面临的挑战,并提出持续治理路径。
一、AI系统安全风险的多层叠加
AI系统安全风险贯穿数据处理、模型训练与精调、模型部署与应用、智能体持续运营等生命周期阶段。文中将可通过补丁或配置加以修正的软件问题称为漏洞或配置缺陷,将模型固有局限称为缺陷或脆弱性,将提示词注入、越狱等称为攻击技术,将数据泄露、越权操作、服务中断等称为安全事件或业务后果。具体分析,风险在以下三个层面呈现。
(一)传统技术栈漏洞与配置风险向AI系统传导
AI系统的运行高度依赖模型推理框架、API网关、向量数据库、消息队列、容器编排平台等传统软件基础设施。这些组件中的软件漏洞、错误配置和不当暴露会形成基础层攻击入口。即使模型本身没有被攻破,攻击者也可能绕过鉴权、读取敏感数据、篡改服务配置,甚至控制模型推理或智能体网关。
2026年5月的BadHost漏洞(CVE-2026-48710)正是这种传导风险的例证:中间件若按请求地址而非真实访问路径做权限判断,攻击者即可绕过鉴权。由于涉及的Starlette框架广泛应用于Python版AI基础设施,一处缺陷便影响全球大量AI服务与推理网关的安全。
2025年1月,DeepSeek旗下ClickHouse数据库被披露存在公网暴露且无需认证,内含超100万行日志,其中包含明文聊天记录、密钥、后端细节等敏感内容。另一类风险来自推理服务自身,NVIDIA 2024年5月发布的公告显示,Triton Inference Server漏洞(CVE-2024-0087)允许攻击者向任意路径写入文件,进而造成代码执行、权限提升、信息泄露或数据篡改。
这些事件时间不同、机理各异,但共同说明AI系统的机密性、完整性和可用性,仍可能被传统软件漏洞、接口权限和基础配置问题直接破坏。
(二)模型层面的内生缺陷与脆弱性
与确定性软件程序不同,大语言模型依据统计模式生成输出,行为具有概率性和上下文依赖性,因此会面临越狱、提示词注入、训练数据投毒、输出幻觉和算法偏差等不同性质的风险。其中,提示词注入利用了模型同时处理指令与数据的机制,其根源在于大模型理解并执行指令的能力,与不被非授权指令操控的安全目标之间存在矛盾。这类风险难以通过传统软件漏洞修复方式彻底消除,需要结合模型对齐、输入输出控制、上下文隔离、工具权限管理和运行时防护等多层机制降低风险。
提示词注入是具有代表性的模型层攻击技术。对此,模型层的评估主要关注非授权指令能否改变模型的判断、绕过安全要求或诱导其引用不应暴露的上下文。当这种影响进一步触发工具调用或外部操作时,其执行后果则属于智能体层风险。2025年6月公开披露的EchoLeak(CVE-2025-32711)展示了这种风险如何进入企业:攻击者把隐藏指令植入精心构造的邮件,当Microsoft 365 Copilot在正常检索该邮件时,模型可能被诱导访问受害者有权访问的内部数据,并将数据发送至攻击者控制的端点。这一案例说明,提示词注入的危害不仅是违规内容的输出,当检索、敏感数据访问与外传通道同时存在时,它可能形成具体的数据泄露链。
除提示词注入外,模型层还包括越狱、训练或微调数据投毒等风险。越狱通过角色扮演、多轮诱导、编码混淆和语义替换等方式试探模型安全边界,单纯依靠关键词过滤难以防范。训练数据投毒和供应链风险则可能在模型上线前为模型植入偏差、后门或非预期行为。这些问题有的属于攻击技术,有的属于模型缺陷或供应链风险,不能全部等同于传统意义上的软件漏洞,对应的防护也需要前移至数据、模型开发、评测和供应环节。
(三)智能体权限与执行链路的系统性风险
当大语言模型被赋予工具调用、代码执行、数据访问和自主决策能力后,风险会从模型输出演变为真实系统中的操作后果。智能体层的风险,关注的重点是任务规划是否偏离目标、工具与权限是否被滥用、高风险动作是否缺少审批,以及异常行为能否被及时发现和中止。
2026年7月,OpenAI与Hugging Face先后发布事件报告,一项运行于OpenAI网络安全能力评测中的自主智能体跨越多个信任边界,从评测环境进入公共互联网并侵入Hugging Face生产基础设施。该智能体在2026年7月9日至13日实施了约1.76万次攻击动作,涉及侦察、凭证获取、横向移动、持久化和数据外传。2025年7月,SaaStr创始人Jason Lemkin披露,在使用Replit Agent开发应用期间,智能体删除了应用数据库中的数据导致线上服务受到影响。
这些案例说明,智能体风险来自“能力、权限、自动化”三者的组合。攻击者可以利用不可信内容操纵智能体,也可能在没有外部攻击者的情况下,因目标理解偏差、环境识别错误或权限过宽而执行破坏性操作。当智能体能够操作数据库、调用API、执行代码或修改系统配置时,安全评估必须覆盖从任务输入、规划决策、工具调用、权限校验到执行反馈的完整链路,并把数据删除、权限扩散、生产中断和敏感信息外传作为可验证的风险后果。
OWASP《智能体应用十大安全风险(2026版)》于2025年12月发布,将智能体目标劫持、工具滥用与误用、身份与权限滥用、智能体供应链漏洞、意外代码执行、记忆与上下文投毒、不安全的智能体间通信、级联故障、人机信任滥用和恶意智能体列为重点风险。这一分类表明,智能体安全的核心为系统能否对目标、身份、权限、工具、记忆、通信与执行结果实施可验证的约束。
二、AI系统安全评估面临的结构性挑战
AI系统风险的多维性和动态性,使传统安全风险评估面临结构性挑战,但并不代表传统方法已经失效。渗透测试、漏洞扫描、配置核查和代码审计仍是发现基础设施与应用漏洞的重要手段;其局限是无法单独覆盖模型概率性行为、语义对抗、检索上下文污染和智能体多步骤执行风险。因此,传统安全评估需要与模型安全评估、场景对抗测试和智能体行为测试形成互补。
(一)静态评估与动态场景的错配
传统安全风险评估主要围绕静态系统边界,通过历史数据、规则匹配和线性分析识别脆弱性。其核心假设是:系统的安全状态可以在某一时间点被穷尽描述,漏洞是可枚举的,攻击模式是可归类的。然而,AI系统的风险形态打破了这一假设。
大模型输出空间高度复杂,高风险行为可能只在特定上下文、语言或多轮交互中出现,依赖固定规则和有限样本的测试难以穷尽所有可能性。更重要的是,AI系统的评估对象已从可枚举的软件漏洞扩展到模型脆弱性、攻击技术和概率性行为风险。缓冲区溢出等传统漏洞通常有明确的修复目标,提示词注入和越狱则可能利用模型遵循自然语言指令的基本机制,仅靠一次补丁难以彻底消除,需要以模型对齐、上下文隔离、权限控制、运行时检测和持续回归测试共同降低风险。因此,评估不应把所有问题都笼统称为“漏洞”,而应分别考察攻击前提、成功概率、可重复性、影响范围和业务后果。同时,提示词模板、第三方插件、知识库、工具调用链等上下游组件也会改变最终风险,传统点对点评估无法覆盖全链路。
(二)资产边界模糊与攻击面扩散
随着智能体进入办公、研发和业务流程,企业部署的AI资产快速增加,但资产可见性往往滞后。许多企业难以准确回答自身对接了多少模型、使用了多少插件、部署了多少智能体。随着智能体创建门槛的降低,业务部门或员工可能绕过IT和安全团队自行搭建,形成未纳管的“影子智能体”。当模型、知识库、工具、身份和外部API之间的连接关系缺乏记录时,攻击面会持续扩大,防护策略也难以找到准确落点。
更复杂的是,多智能体协作场景中的交互路径呈网状扩散,权限在智能体之间传递和继承,传统基于角色的访问控制模型不再适用。例如,企业部署了数百个智能体,但无法确定哪些智能体可以访问用户敏感数据。在多轮对话和多智能体协作中,权限漂移和上下文污染可能导致一个原本受限的智能体逐步获取越权能力。智能体资产台账的缺失直接导致威胁建模失去输入锚点:不知道有哪些智能体、部署在哪里、具备哪些能力,就无从评估智能体的风险,更无从实施防护。
三、构建AI系统安全防护体系
面对AI系统安全风险的多维性、动态性和评估挑战,安全防护需要从单点工具走向体系化建设。这里可使用“资产、威胁、脆弱性”作为操作分析框架:通过资产梳理建立可见性基础,通过威胁建模明确防护目标,通过多层次技术评估识别漏洞、缺陷和脆弱点,最终以持续治理机制推动整改、复测和迭代改进。
这一操作框架并非替代现有治理标准,而是完善其企业落地路径。NIST《人工智能风险管理框架1.0》提出治理、映射、测量、管理四项核心功能;MITRE ATLAS给出针对AI系统的对抗战术与技术;OWASP系列Top 10则帮助组织识别大模型应用和智能体应用的重点风险类别。“资产、威胁、脆弱性”分析,解决的是给定环境中的执行问题:从哪些资产开始,优先验证哪些威胁,如何确认脆弱点,以及整改后如何进入下一轮持续评估。
(一)资产梳理与威胁建模:摸清攻击面的前提
安全防护的第一步是明确保护对象。AI系统的资产梳理需要超越传统的配置管理数据库(CMDB)思维,不仅覆盖服务器、容器和网络设备,还要系统性地识别和登记基础模型、推理框架、智能体平台、工作流引擎、检索增强生成(RAG)知识库、向量数据库、插件与工具组件、外部API接口等AI特有资产。
当前,较成熟的实践路径为工具扫描与人工访谈相结合,通过自动化工具发现网络可达的AI相关主机和服务,再通过定向访谈深入了解智能体的架构、业务逻辑、功能目标和用户群体,最终形成包含资产类型、部署位置、业务归属、数据敏感度、现有防护措施的结构化资产清单。
在产业实践中,有效的资产梳理是一个长期工程。AI系统的资产形态具有高度动态性:新的智能体每天在创建,模型版本频繁更替,API接入关系不断变化。资产清单的维护需要嵌入企业已有的IT治理流程,将AI资产纳入配置管理数据库的覆盖范围,建立变更管理机制,确保每一次新增或变更的AI资产都能够被及时登记和评估。
在资产清单基础上,威胁建模的目标是识别具体场景中的潜在攻击者、入口、权限、数据与业务后果,并按影响和可能性确定优先级。威胁建模的价值是将系统可能被攻破的路径,转化为可操作的问题:在某一业务场景中,哪些资产最重要,攻击者可以从哪里进入,智能体能够做什么,失败会造成什么后果。
(二)多层次技术评估:广度扫描与深度对抗并重
在AI系统安全评估中,自动化工具能够提供覆盖广度但缺乏对抗深度,人工测试能够模拟真实攻击者但受限于效率和经验。因此,有效的评估策略必须两者结合。
在广度层面,自动化评估工具依托规模化测试数据集对基础模型进行批量化安全检测,覆盖违法违规内容生成的多个方向,验证模型在不同攻击类别下的脆弱点分布,测试模型在不同语言、场景和表达方式下的安全表现差异。这一层的目的是快速识别共性问题,为深度测试提供输入和优先级排序。
在深度层面,由具备攻防经验的测试人员对智能体、工作流、RAG场景和业务功能进行人工对抗测试,其核心是模拟真实攻击者逐步试探与突破的过程,关注攻击策略的变化调整和场景上下文的深度利用。测试重点包括:系统提示词是否容易泄露、是否存在直接和间接提示词注入风险、知识库是否存在越权访问和投毒问题、工具与插件是否存在越权调用和参数滥用风险、工作流是否存在逻辑绕过和执行边界失控、多轮对话中是否发生权限漂移和上下文污染。
针对自主智能体场景,还需专项验证最小权限原则的落实。包括智能体的工具权限是否严格收敛到真正需要的范围、高风险操作的确认机制是否可被绕过、调用链中的权限传递是否存在放大效应,以及异常情况下的熔断与中止能力是否可靠。
AI系统安全评估与传统安全评估的判定方式存在显著差异,但二者并非割裂。对于SQL注入、认证绕过等软件漏洞,仍可依据明确的触发条件和利用结果作出判断;对于提示词注入、越狱和模型偏差等问题,则需要结合上下文、重复测试和实际后果进行风险判定。一次提示词注入是否成功,不仅要看模型是否遵循了非授权指令,还要判断是否造成敏感数据暴露、权限越界、工具误用等后果。评估指标可包括攻击成功率、跨语言与跨场景稳定性、所需权限、可重复性、影响范围和可检测性,并区分可确定性利用的漏洞与概率性风险。对前者,应精确修复;对后者,则通过风险阈值、持续监控、回归测试和分层防护进行管理。NIST AI RMF的“测量”和“管理”功能可为指标设计与风险处置提供参照。
在基础设施层面,常规渗透测试聚焦API接口鉴权、输入校验、权限控制、会话安全、环境配置、密钥管理和网络暴露等传统安全问题。这些问题在AI系统中同样存在,且可能因AI系统的开放架构特征而更易被攻击者利用。
(三)从评估到治理:建立持续迭代机制
评估的终点在于改进,一套可持续的AI系统安全防护体系需要在评估结果与安全加固之间建立完整的治理链路。
评估完成后,应形成覆盖模型安全、数据安全、应用安全、基础设施安全和管理机制多维度的整改建议,并协助企业制定整改实施路线。具体可分三个层次:对可在短期内通过配置调整、权限收敛和提示词加固解决的问题,制定快速修复方案;对涉及系统架构调整、安全产品部署或开发流程改造的中长期问题,纳入迭代规划并明确责任方和时间节点;因技术条件或业务限制暂时无法根治的风险,制定过渡性缓解措施并持续监控。
整改是一项持续性的工作。AI系统的模型版本会迭代、业务场景会扩展、新的攻击手法会涌现,因此,需要建立从持续评估到加固、复测的周期性治理方案。在关键业务场景上线或重大版本变更前,应设置安全评估准入门禁,确保系统经过与其风险级别匹配的安全验证。对于已运行的生产和业务系统,应建立定期巡检机制,跟踪模型安全表现的漂移和新增攻击手法的影响。
AI安全之所以需要持续治理,根源于AI系统安全风险的两个固有属性。其一,模型的安全表现不具备传统软件的版本稳定性。同一模型在微调后、提示词模板变更后,甚至对话上下文不同时,其面对同一攻击手法的响应可能完全不同,因此需要建立安全回归测试机制,将关键安全场景纳入模型每次发版前的必测项。其二,智能体的攻击面随其能力扩展而动态扩展。每新增一个工具、接入一个外部API或集成一个新的模型上下文协议(MCP)服务,都意味着新的攻击路径被打开,因此需要将安全评估嵌入智能体的变更管理流程,在权限边界发生任何变化时自动触发重新评估。
在技术手段上,运行时防护是评估后的关键补充,但不能仅理解为输入、输出的内容过滤。运行时防护应覆盖提示词与响应检测、工具调用白名单和参数校验、身份与权限复核、敏感数据访问控制、代码执行与外部API调用限制、异常行为检测、高风险操作审批、会话和任务隔离、速率限制以及熔断与紧急停止。对删除数据、修改生产配置、对外发送敏感信息等不可逆或高影响操作,应由模型之外的确定性策略引擎执行校验,并保留人工确认和完整审计记录。运行时防护能够在脆弱点尚未根治时降低风险,但不能替代架构整改、最小权限和安全开发流程。
四、结 语
AI安全治理的关键,是建立能够随着模型、数据、工具、权限和业务场景变化持续调整的治理机制。企业既要修复传统软件漏洞和配置缺陷,也要正视模型行为具有概率性、智能体攻击面动态扩展的客观规律,把安全评估嵌入AI系统的设计、上线、变更和运行全过程,并通过持续评估、监测、复测和不断校准,才能在推进AI应用的同时,确保人工智能安全、可靠、可控。
(本文刊登于《中国信息安全》杂志2026年第8期)
声明:本文来自中国信息安全,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。