近日,美国国家标准与技术研究院(NIST)对外发布《AI 数据中心安全分析:基于高性能计算的分析框架》(AI Data Center Security Analysis: An HPC-Driven Approach,下称“报告”)。报告梳理了AI数据中心的专属架构特征,系统拆解了当前面临的各类安全风险,为搭建标准化AI算力安全分析体系奠定了核心基础。

报告指出,伴随大模型持续迭代扩容,当前AI数据中心普遍部署了超大集群计算单元、低时延高速互联网络,以及多层级复合存储架构。对比传统高性能计算(HPC)集群,AI算力设施在计算任务类型、数据流转逻辑、上层业务应用模式上均存在本质差异,也由此催生了诸多此前未曾出现的安全隐患。基于这一现状,行业亟需一套独立适配AI场景的安全分析逻辑与完整防护体系。
现阶段AI数据中心暴露的核心风险集中在几大维度:超大规模基础设施带来的运维管控难题、训练数据集与自研模型的泄露窃取风险、虚拟化集群固有安全漏洞、多租户共享算力引发的隔离隐患、软硬件全链条供应链攻击,以及各类AI原生新型攻击手段。随着AI数据中心承载的数据体量、训练推理任务持续攀升,算力、数据、模型三层基础设施的安全保障能力,已经成为AI业务稳定可靠运行的核心前提。
AI数据中心新型基础设施体系
AI数据中心与HPC系统具有密切的技术渊源,整套设施需要协同调度海量加速计算节点、高速互联网络与分布式分层存储。如今大模型训练需求持续激增,新一代AI数据中心普遍采用高密度AI加速芯片集群与低延迟高速互联方案,整体算力规模已经超越不少传统顶级超算。
资源调度层面,两类主流工具分别适配不同集群场景:SLURM仍是传统HPC风格AI集群的主流任务调度工具,Kubernetes则在虚拟化容器化AI环境中得到越来越广泛的应用。针对大模型训练、微调、推理全流程,报告列举了多款行业主流工具:Megatron Core支持模块化搭建超大规模生成式AI训练管线;DeepSpeed侧重优化训练吞吐、降低显存占用;NVIDIA NeMo则集成了全套工具链,覆盖AI智能体的开发、性能调优与合规治理全流程。
AI数据中心的存储架构需要完整适配AI全业务链路,覆盖原始素材存储、数据预处理、模型训练、在线推理全环节。训练与推理环节会在存储、CPU、内存、加速芯片之间产生海量高频数据交互,这就要求存储系统同时满足超大容量、高吞吐带宽、极低访问延迟、安全可控等核心指标。其中对象存储是整套存储体系的核心底座:它以独立对象单元管理数据,配套自定义元数据与唯一标识,横向扩展能力、数据容错性、长期存储稳定性优势突出,非常适合音视频、图片等海量非结构化素材归档,同时可支撑超大规模并行训练任务。
AI数据中心面临的安全威胁
传统HPC集群存在的安全问题,在AI数据中心内依然会持续存在;但受算力规模、业务模式变化影响,AI场景衍生出大量新的安全挑战。
第一重压力来自超大体量算力集群带来的运维管控难度。现代AI数据中心整合了海量加速卡、内存单元与分布式存储,需要将分散资源统筹为一套稳定协同的运行环境,运维复杂度呈指数级上升。同时大模型的完整训练周期动辄数周乃至数月,任意单个硬件节点故障,都有可能导致整轮训练任务中断,这就要求集群配套完善的故障识别、断点续训与灾备恢复机制。
第二大重要风险聚焦数据全生命周期安全。数据集质量直接决定模型训练效果,高质量素材的采集、溯源留痕与长期归档都需要极高投入,同时原始训练数据、模型权重参数、训练中间张量都具备极高商业价值,数据外泄、模型窃取、数据集投毒是AI数据中心高发的安全事件。
报告特别指出,AI模型存在“黑盒”特性,运维人员很难核验训练、推理过程中模型是否记忆、泄露了敏感信息,因此数据中心必须落实多层级防护手段,包括端到端加密、精细化身份权限管控、模型输入输出全链路监控,以此降低信息泄露风险。
AI数据中心除常规网络攻击外,还要应对专门针对大模型的新型攻击,其中提示词类攻击是报告重点警示的风险。仅依靠模型自身内置的安全围栏无法彻底抵御这类威胁,必须依托数据中心底层基础设施配套专项防护,比如上下文权限管控、输入输出安全过滤管线,从算力底层拦截恶意攻击。报告详细列举了几类依托模型输入发起的攻击手段:
模型蒸馏攻击:攻击者通过高频批量调用模型接口,采集大量输入输出对应样本,再利用采集到的数据复刻出行为高度近似的仿制模型,实现核心知识产权窃取;
模型结构探测攻击:属于前置侦察手段,攻击者反复查询目标模型,反向推导模型分类逻辑、能力边界,为后续定向攻击铺路;
黑盒攻击:攻击者完全不掌握模型内部结构与参数,仅通过不断调整输入观测输出变化,挖掘安全控制漏洞,诱导模型输出错误结果;
提示注入攻击:攻击者构造恶意提示文本,绕过模型安全限制,驱使模型执行非授权操作、泄露后台隐私数据,大语言模型是这类攻击的重灾区。
除此之外,报告还梳理了固件底层漏洞、加速芯片硬件侧信道攻击、跨地域多中心协同训练劫持、供应链投毒、内部人员违规操作、静默数据损坏(SDC)、多租户算力资源隔离失效等十余类衍生安全隐患。
构建面向AI数据中心的安全防护体系
针对上述多层次、多类型的安全风险,报告提出了一套完整可落地的AI数据中心安全防护架构,主要分以下环节落实管控:
第一,强化访问区边界防护。AI网关作为外部业务与内部AI算力服务的唯一中转节点,统一承接外部请求,承担流量调度、内容安全过滤、分级访问权限管控的核心职能。运维团队需要完整留存每一条用户请求和对应模型输出响应记录,依托日志数据快速识别异常调用、批量窃取类行为。
第二,搭建全集群统一安全监测能力。数据中心需要完善全链路日志采集、实时异常检测、自动化合规校验体系。AI算力集群大多为多租户共享环境,平台需要持续跟踪用户访问轨迹、数据与模型调取记录、集群内部跨进程通信行为,第一时间捕捉异常访问、数据批量导出等危险动作。
第三,以零信任作为底层安全架构设计核心。传统防火墙、VPN这类边界防护手段,很难抵御内部账号泄露、供应链植入后门、横向渗透等风险;零信任架构默认所有访问主体、设备、应用均不可信,针对每一次操作持续核验身份与权限。即便集群内某一组件被攻破,也能阻断攻击者横向移动,避免核心模型、训练数据集被盗取。同时可搭配硬件信任根、机密计算技术构建硬件可信底座,抵御BMC、UEFI等底层固件层面的劫持攻击。
第四,建立人机协同的治理审核机制。模型上线、大规模数据导出、权限批量变更等高风险操作,单纯依靠自动化策略存在管控盲区,必须配套人工复核流程。在模型投产前,由专人核验权限分配、版本校验、上线审批流程全部合规,避免存在缺陷、未经审核的模型直接流入生产推理环境。
文章参考来源|美国国家标准与技术研究院、互联网公开信息
声明:本文来自赛博研究院,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。