随着智算中心向大规模集群演进,远程直接内存访问(RemoteDirectMemoryAccess,RDMA)凭借低时延、高带宽和内核旁路等特点,成为机间高性能通信的重要技术。RDMA内建机制能够提供基础报文校验、内存访问控制和资源隔离,但仍存在身份认证不足、完整性保护缺失、明文传输和访问授权粒度有限等问题。本文分析RDMA内建安全机制及其局限,梳理四类典型安全风险,并提出安全认证加密、内存保护密钥派生和DPU/智能网卡安全卸载等防护技术,为智算中心机间互联安全建设提供参考。
RDMA技术原理及安全机制
(一)RDMA技术原理
随着大模型训练和推理规模持续扩大,智算中心正由单机计算向大规模集群演进。RDMA允许一台主机的网卡直接访问另一台主机的内存空间,无须操作系统内核参与数据传输过程,具有零拷贝、内核旁路和低时延等优势,已成为智算中心机间互联的主要通信技术。RDMA通信流程如图1所示。

图1 RDMA通信流程(以RDMA WRITE为例)
(二)RDMA安全机制
RDMA本身提供了一定的基础安全机制,主要包括报文格式与字段校验、内存区域(Memory Region,MR)与访问密钥、保护域(Protection Domain,PD),实现报文合法性校验、内存访问控制和资源隔离。
报文格式与字段校验
RDMA接收端网卡在处理数据包时,会依次对循环冗余校验码(CRC)、队列号(QPN)、包序列号(PSN)、远程密钥(rKey)和虚拟地址等关键字段进行校验,确保数据包顺序正确且具有访问权限。相关校验未通过时,网卡将拒绝相应请求或进行错误处理,避免非法访问继续执行。
内存区域(MR)与访问密钥
RDMA仅允许访问预先注册的内存区域。应用程序需先向网卡注册内存,由网卡记录其地址、长度和访问权限,并分配访问密钥rKey和lKey。其中,rKey用于授权远端访问,lKey用于控制本地设备访问。远程请求只有携带正确的rKey,且访问范围位于对应MR内,才能完成读写操作,从而防止远端任意访问主机内存。远程密钥rKey的作用如图2所示。

图2 远程密钥rKey的作用示意图
保护域PD
保护域用于隔离不同RDMA应用或进程的资源。队列对(QP)、内存区域(MR)和完成队列(CQ)等资源均属于特定PD,只有同一PD内的资源才能关联访问,从而实现RDMA资源隔离,防止不同应用之间发生越权访问。如图3所示,节点A的QP0与节点B的QP0通信时,只能访问节点B中的MR0,不能访问MR1。

图3 保护域实现资源隔离示意图
RDMA安全存在不足
在可信网络环境下,RDMA内建安全机制能够提供基础安全防护。但由于其缺少身份认证、完整性验证、传输加密和细粒度授权等安全机制,在非可信网络环境面临以下安全风险。
(一)通信身份缺乏密码学认证机制,存在身份伪造、业务中断风险
RDMA主要依据QPN、PSN、rKey等协议字段判断报文是否合法,并未对通信双方身份进行密码学认证。攻击者一旦获取或预测相关字段,可伪造RDMA报文持续注入非法请求,导致合法连接异常中断,正在执行的模型训练、参数同步被迫终止。
(二)报文缺乏完整性保护,存在数据篡改风险
RDMA内建CRC主要用于检测随机传输误码,不能识别攻击者对报文头部和负载实施的恶意修改。攻击者一旦截获合法RDMA报文后修改负载,可伪造报文注入网络,造成模型参数、训练数据或数据库记录被覆盖,导致推理结果异常或业务数据损坏。
(三)传输负载默认明文,存在链路窃听和敏感数据泄露风险
RDMA原生协议默认不提供端到端加密,模型参数、训练数据和中间结果以明文形式在链路上传输。攻击者通过端口镜像、链路接入、光分路或中间人方式捕获RDMA流量,造成模型资产和数据资产泄露。
(四)访问控制依赖基于令牌的访问密钥,存在越权访问风险
RDMA通过MR和rKey控制远程内存访问权限,但rKey本质上属于访问令牌,而非动态身份认证凭据。一旦rKey泄露、预测或被非法获取,攻击者即可绕过应用层授权直接访问已注册内存区域,造成敏感数据泄露或内存篡改。
RDMA安全增强技术
针对RDMA安全存在的不足,构建安全认证加密技术、内存保护密钥派生技术和DPU/智能网卡安全卸载技术三项安全增强技术,在尽量保持低时延、高带宽优势的同时,增强RDMA通信的机密性、完整性和访问可控性。
(一)安全认证加密技术
针对不同业务的安全等级和性能要求,设计头认证、包认证和认证加密三种模式。头认证主要保护QPN、PSN、地址等报文头字段,可防止身份伪造和控制字段篡改,但不能保护传输负载;包认证进一步对明文负载进行完整性校验,可同时防范报文伪造和数据篡改,但无法防止链路窃听;认证加密对负载进行加密,并对报文头和密文进行联合认证,可同时抵御身份伪造、数据篡改和链路窃听。对于越权访问风险,三种模式均需与内存保护密钥派生技术配合,实现访问权限与内存地址范围的绑定。
(二)内存保护密钥派生技术
内存保护密钥派生技术将原有基于rKey的令牌式授权增强为基于密钥派生的密码学验证。由保护域根密钥派生内存区域密钥,并进一步派生与不同内存子区域绑定的子密钥;对于更细粒度的子区域,可由上一级子密钥继续派生。访问时,子区域密钥参与报文认证,若访问地址被篡改或超出授权范围,接收端无法使用匹配密钥完成认证,从而降低rKey泄露引发的越权访问风险。
(三)DPU/智能网卡安全卸载技术
为避免密码运算削弱RDMA性能,将安全功能从主机侧卸载至DPU/智能网卡硬件层面,利用硬件加速引擎,实现高性能通信与安全防护协同优化。

图4 DPU/智能网卡安全卸载部署示意图
如图4所示,在计算节点接入侧部署安全DPU/智能网卡,将RDMA报文认证、加解密、密钥管理及访问校验等功能下沉至网卡硬件执行。安全网卡在报文进入Leaf交换机前完成发送侧保护,并在接收端完成校验和解密,实现端到端安全处理。该方式不改变现有Spine-Leaf组网,可减少主机CPU参与安全计算带来的性能开销,并支持安全能力随计算节点横向扩展,兼顾RDMA低时延、高吞吐需求。
小结
RDMA为智算中心机间高性能通信提供重要支撑,但仍面临身份伪造、数据篡改、链路窃听和越权访问等风险。本文提出安全认证加密、内存保护密钥派生和DPU/智能网卡安全卸载技术,在兼顾通信性能的同时,增强RDMA的机密性、完整性和访问可控性。未来,建议进一步推动安全机制与RDMA协议栈、网卡硬件协同演进,完善密钥管理、性能测试和安全评价方法,加快相关技术标准化与规模化应用,为智算中心安全建设提供支撑。
作者:
张逸然、阎军智、杜海涛 | 中国移动研究院安全技术研究所(中国移动人工智能安全治理研究中心)
审核:
都晨辉 | 中国移动研究院安全技术研究所(中国移动人工智能安全治理研究中心)
声明:本文来自中移智库,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。