先说一个不那么体面的现象。过去十几年,国内的网络靶场建了不少。剪彩的时候都很风光:领导讲话、大屏点亮、红蓝对抗打得烟花四溅,媒体记者快门按得飞起。可三年之后再去看,不少靶场的机房比图书馆还安静——设备在,电表在走,人没了。
这事儿怪谁呢?怪建设方偷工减料?冤枉。怪用户不识货?也不尽然。我琢磨了很久,觉得根子出在一种认知上:我们一直把靶场当成一个"工程"来建,而人家把靶场当成一门"生意"来运营。工程有竣工验收,生意没有——生意只有开张,和倒闭。
美国的PCTE(Persistent Cyber Training Environment,持久网络训练环境),就是把这门"生意"做到目前为止最像样子的一个样本。从2016年《国防授权法案》第1645条给它"上户口"算起,这个项目折腾了快十年,如今已长成一头怪兽:八千多名网络战士在册,数万量级的虚拟机随调随用,PB级的训练内容库,非密、机密、绝密三个密级通吃。2025年5月,它还完成了一次身份转变——从传统的大型装备采办项目转入"软件采办路径",说人话就是:不再按盖楼的逻辑管理,改按互联网产品的逻辑迭代。
这篇文章,咱们就干三件事:拆机器,翻菜谱,聊聊AI进场之后这门生意会变成什么样。拆机器的时候我会习惯性地追问"为什么只能这么做"——选型背后的受力结构,比选型本身有意思得多。中间我也会不断"抬杠"——对PCTE抬杠,也对自己抬杠。因为靶场这个行业,最缺的不是赞美,是质询。
一、"持久"二字,到底贵在哪儿
PCTE的名字里,最值钱的不是Cyber,不是Training,是Persistent——持久。
这个词得咂摸。什么叫不持久?办酒席就是不持久:提前一个月订场地、发请帖、搭台子,热热闹闹一天,曲终人散,桌椅归位,下次再办,从头再来。美军过去的网络训练,基本就是这个路数——年度大戏"网络旗帜"(Cyber Flag)演习,筹备小半年,打完收工。平日里各军种自建的小靶场各唱各的调,环境不通用、内容不共享、标准不统一,活像一桌桌各办各的流水席。
反过来,"持久"也不等于"服务器常年开着"。机器7×24小时转,那叫开着,不叫持久。PCTE语境里的持久,我拆开看至少有三层意思。
第一层,环境的持久。训练环境不是用完即焚的一次性筷子,而是可以保存快照、随时回滚、反复复用的"老卤"。今天的学员在里头打砸了,清空重置,明天的学员进来,还是那块干净的案板。
第二层,内容的持久。网络攻防这行,内容是有保鲜期的——去年流行的TTP(战术、技术与过程),今年可能连脚本小子都不屑用了。内容持久不是"存着不动",而是有一条流水线,把近实时的威胁情报持续喂进场景库,让菜谱跟着季节换。
第三层,关系的持久。学员有学籍、有成长档案,团队有认证记录,环境有版本谱系。昨天的训练是今天训练的垫脚石,数据一层层沉淀下来,越用越值钱。
这三层合起来,说到底是一句话:把靶场从"项目制"改成"平台制"。项目制的尽头是验收报告,平台制的尽头是日活用户。认知差就差在这儿——所以我说,PCTE最值得国内同行学的,不是哪台设备哪个软件,而是这个"当生意做"的底层认知。
好,认知层面抬完了杠,咱们撸起袖子,拆机器。
二、解剖台之一:两个平面、一堵墙、一条总线
靶场最怕什么?怕"演习变成事故"。学员在里头玩的是真刀真枪的恶意代码,万一哪个小家伙捅破了隔离层,溜到生产网、溜到互联网,那就不是训练了,是新闻。所以靶场架构的头一条铁律是隔离,第二条才是仿真。顺序不能反——仿得再真,漏了,全盘皆输。
PCTE对这个问题的回答很干脆:一刀切下去,分出两个平面。这个切法不是媒体解读,是官方自己的口径——2026年6月,陆军合同司令部奥兰多分部代项目办公室发了一份灰空间信息征集书(RFI),里头白纸黑字写着:PCTE采用层级化的两平面架构,控制平面托管经过加固和认证的服务(训练门户、服务台、仪表盘),并负责资源调配;逻辑隔离的事件平面里跑虚拟机、容器和软件定义网络,动态生成靶场环境。
控制平面是"前店",事件平面是"后厂"。前店着火不烧后厂,后厂爆炸不塌前店。到这里,一般的介绍文章就该翻页了。咱们不翻,接着问三个问题:墙砌在哪儿?门开在哪儿?还有没有人漏画了?
先说漏画的那个。公开的架构图大多是两个平面,但美国国防部自己的靶场互操作词典(CRIS词典,TRMC赞助、林肯实验室参与编辑的那份术语标准)把靶场网络规范成了三个平面:控制平面、事件平面之外,还有一个仪表平面。仪表平面干一件事:数据采集与评估——传感器、日志、抓包、评分证据,全从这层走。
为什么要单独立一个平面?因为传感器长在事件平面里头,就在爆炸半径之内:学员的恶意代码会把传感器当靶子打,而评估数据又得一条不漏地运出来。工程惯例上,这层通道按只出不进来设计——探针往外送数据,外头不许顺竿爬进来。词典对控制平面还有句狠话:它得是一张跟事件平面完全独立的网,控制活动不得以任何方式干扰事件执行。白队(导演组)就待在控制平面,词典给它的授权是通常握有影响和修改想定执行的权力——导演在演播室里按按钮,演员在舞台上挨炸,演播室的电门和舞台上的炸药,不走同一根线。
再说墙。事件平面里的虚拟机跑的是真实恶意代码,而恶意代码这玩意儿,职业生涯就干一件事——找墙缝。学员引爆的样本里,保不齐就有盯着虚拟机逃逸(VM Escape)的漏洞利用。所以靶场真正的承重墙,不是防火墙规则,而是虚拟机监控器(Hypervisor)本身。这位老门卫的每一块砖——特权操作的陷入处理、虚拟网卡的半虚拟化驱动、内存的二层地址翻译——都必须经得起恶意输入的捶打。业界为什么都挑那几家老牌商用虚拟化平台?买的其实是这位老门卫的体格——它被全世界的攻击者免费"体检"了二十多年,拳脚全是实战喂出来的。自己攒一个冷门的虚拟化底座去关恶意代码,等于请一位没上过擂台的保安,去看住一位拳王。
这个判断不是我替官方下的,是官方自己认的。灰空间RFI里有一问,问法少见地直白:你的方案如何在事件平面内安全地执行、控制并收容恶意流量和不符合STIG加固标准的灰空间实体,同时不危及底层容器和虚拟机监控器的安全态势?把这句话翻译过来就是——我们知道墙就是Hypervisor,你告诉我,你的方案怎么不给这堵墙增加裂缝。
墙砌好了,门呢?门是管理通道:控制平面要往事件平面里下发指令——创建虚拟机、挂载镜像、注入流量、采集数据。门只要开着,就有被人从里面推开的风险。工程上的讲究全在细节里:按隔离设计的惯例,管理接口走独立的带外网络,指令通道单向化、白名单化,事件平面的流量永远不允许路由进管理网段;学员接入走代理和跳板,看到的是远程桌面和终端的"影像",而不是网络层的"肉身"。这套惯例在PCTE的硬件配方里落了实:每个区域算存节点自带一张带外管理网,用于对设备做远程"关灯"管理——管理员进出机房走自己的走廊,这条走廊在物理上就是另一张网。
接下来拆配方。同一个RFI把技术栈也自报了:VMware Cloud Foundation打底,NSX-T做软件定义网络,F5守边缘,Red Hat SSO管认证。这四样摆在一起,每一样都有受力分析可做。
NSX-T是里头最见功力的一块。官方架构里有个关键词——微分段,意思是用软件把租户之间的东西向流量焊死。这话怎么落地?落地方式是把分布式防火墙塞进每台Hypervisor的内核,贴着每张虚拟网卡做有状态过滤——东西向流量在原地就被拦住,不用绕路去某台硬件防火墙排队。这就是为什么"隔壁班的病毒不许串门"这句话,能在数万虚拟机的尺度上成立:规则不砌在围墙上,是嵌在每扇门的门框里。围墙再高也有门,门框里的锁没有门。
F5守的是极少数的物理门——南北向的出入口。Red Hat SSO管的是另一件事:门户、服务台、仪表盘、内容库,几十个服务共用一张身份,认证收口到一处。这四样全是商用大牌,原因得往认证经济学里找:每一块积木都背着现成的安全评估背书,拿它们盖房子,运行授权(ATO)才有人敢签。而且靶场自身的安全测评也不是自说自话——预算文件里写得明白,平台要接受NSA认证红队主导的紫队评估。关恶意代码的房子,得请最专业的开锁匠来验收。
再看硬件这一层,CIC-3挑战赛的官方问答里给出了一份罕见的配方。一个区域算存节点(RCS)塞64台计算节点,每台双路22核、680GB内存——做道算术,满配就是2816个物理核、43TB内存;虚拟化跑vSphere,vCenter统一管理。但有意思的是网口:计算节点配万兆融合网卡,存储阵列配40GbE。注意口径,40G在阵列侧、几十台机器共享,万兆是每台计算的网卡,不能直接比大小;可方向感已经足够清楚了——这套架构舍得给存储的带宽,远比给单机互联的多。一个合理的猜测是:架构师判断真正的瓶颈不在计算,在数据通路——镜像读取、快照写回、数据采集,全走计算到存储这条大动脉,所以闪存阵列拉满、带宽给足。配方即受力图。
这样的节点,PCTE铺了七处:戈登堡(2023年已更名艾森豪威尔堡)、米德堡、萨福克、圣安东尼奥、瓦胡岛、维克斯堡、奥兰多(开发与运维),RCS之外还新增了企业算存站点(ENT)。把算力铺到用户跟前,为的是两件事:时延和密级接入——学员在夏威夷和在马里兰,敲键盘的手感得一样。节点之间互为备份,内容跨节点分发回填,一处塌了另一处接(COOP灾备)。分布式系统的最后一公里永远是人:合同里要求承包商在每个节点附近派驻区域联络官,正常工作时间三十分钟内到场。
最后拆那条最容易被忽略的暗线:总线。官方问答里写,厂商的服务挂进控制平面,走的是事件总线架构——每个服务向总线发布和订阅消息。配套的还有两条死规定:不许共享数据库实例,不许共享数据结构;服务间通信走定义良好的API或消息事件,优选后者。为什么定这么死?因为PCTE是个"集成商开放日"式的平台——挑战赛年年往里头接新厂商的组件,集成周期上限十二个月。没有总线,每接一个厂商就是一次开胸手术;有了总线,新服务就是插线板上的新插头。"不共享数据库"这条最狠:它把数据耦合这条路从源头掐死——两家厂商的服务想私下勾兑状态,只剩两条明路:要么走定义良好的API,要么在总线上公开喊。灰空间RFI里顺势问厂商:你的方案能不能原生发布订阅Kafka、RabbitMQ事件?——总线选型虽未官宣,候选区间已经划出来了。
再多说一嘴密级。PCTE要在非密、机密、绝密三个安全域里同时跑,界面体验还得一致。外行看着是"复制三份",内行看着是噩梦。噩梦长什么样?先看场地:涉密工作区(SCIF)要按ICD 705系列标准建设,十二个月内就绪、等政府来认证。再看线路:能接进驻地的网络,是DREN、商业ISP、JMN、JIOR、JWICS这几条专线——每一条背后都是另一套认证体系、另一拨签字的授权官,接哪条不归你选,归你要办的事选。然后是授权本身:平台已经拿下覆盖三个密级的三年期运行授权,下一步的计划是把授权官角色从陆军移交网络司令部,并经JWICS扩展高侧接入,支撑进攻性网络作战训练。内容怎么跨域发布?低密级往高密级送相对好办,高往低就是脱密审查的钢丝。机密域演习时,能不能调用非密域训练的AI模型?模型的权重也是数据,权重里可能"记住"了训练语料里的敏感信息——这一条,是AI时代给跨域摆渡出的新考题。国内靶场同行如果有志于政企多密级市场,这块的坑,一个都绕不开。
把这一节收个尾:靶场设计的默认假设,是事件平面已经被攻破。所有安全设计都不赌"里头不出事",只保"里头出了天大的事,外头浑然不觉"。两平面分工、三平面隔离、门框里的防火墙、带外的走廊、总线上的公开喊话——全是这一个假设长出来的枝叶。
三、解剖台之二:灰空间——把"互联网"塞进盒子里
靶场仿真有个悖论:攻防是在网络上发生的,可你不能真把学员放到互联网上去练。于是所有靶场都得回答一个问题:你的"假互联网"有多真?
业内的玩笑话是:很多靶场的互联网仿真,就是三台虚拟机互相ping。学员进去一通扫描,发现整个"赛博空间"比自己宿舍局域网还小,瞬间出戏。
PCTE管这个东西叫"灰空间"(Grey Space)。2026年那份灰空间RFI,向业界征求更强的仿真互联网能力,征集令上写着三个关键词:逼真、规模、可控。这份文件值得逐字读,因为它的问询清单,就是一张"逼真度检查清单"。
先看官方对仿真互联网的组成定义,五件套:核心骨干(模拟ISP、骨干路由器、对等互联点),公共服务(DNS、Web、邮件、社交媒体、云),用户种群(自动化用户代理生成流量和行为),对手基础设施(威胁行为体、僵尸网络、C2服务器),防御基础设施(蓝队工具、传感器、监控系统)。最后这件最耐琢磨——连"防御方"都是环境的一部分。靶场里的互联网,连免疫系统都长。
再看问询清单里最硬的几问,挨个拆。
第一问:你的方案能不能复制全球路由表和自治系统号(ASN)?这一问直接划掉了市面上一大批产品。真实互联网的BGP全表在百万条前缀的量级,还在不停地抖动、收敛、抽风。盒子里要长出一张会呼吸的路由表:前缀要能涨落,路由要能收敛,劫持要能演——RFI里点名要演BGP劫持场景。为什么较真这个?因为路由层的攻防课目,你在三台虚拟机上永远教不出来;学员学的劫持手法,只有在一张像真表一样的表上,才看得出涟漪往哪传。
第二问:你的方案能不能使用公网IP段而不向真实互联网泄露流量?这句问法听着平淡,实则凶险。仿真互联网用真实公网IP才有真实感——威胁情报、地理库、信誉库才对得上号;但只要漏一个包出去,就是把训练流量打到了别人真实的网络上,训练事故直接升级成外交事件。所以出口必须是只出不进的单向阀:路由策略宁可错杀不可放过,火星地址过滤拉满,物理上最好气隙。RFI紧接着就问:你的整套能力能不能完全气隙运行?两问连着读,官方的心思就明白了——他们要的不是"尽量不漏",是"物理上不可能漏"。
第三问是一组:DNSSEC校验、HTTPS解密检查、自治根CA层级的仿真。合起来是一件事:盒子里的PKI是独立王国。为什么要在盒子里做HTTPS解密?因为真实互联网八成流量是加密的,学员的检测课目如果只能看明文,等于练了一个2010年的互联网。要在盒子里解密,就得在盒子里自建根CA,给每个仿真网站发证书——造一个完整的、假的信任体系。这大概是靶场工程里最具哲学意味的一笔:为了逼真,先伪造信任。
第四问:你的方案能不能原生发布订阅Kafka、RabbitMQ事件,与政府提供的API网关和消息总线集成?这一问把灰空间的身份点明了:它不是外挂进去的孤岛,是总线上的公民——演习状态要和导演工具、评估工具实时同步,仿真互联网本身只是事件总线上的又一个服务。
这四问读完,再回头看那句"三台虚拟机互相ping",就知道差距不在设备清单,在问题清单。
背景流量的门道,也值得补几句。新手最容易踩的坑,是拿真实网络抓的包来回放,冒充背景流量。这招糊弄演示可以,糊弄训练不行——回放是录音,真实流量是现场:录音里的对话时间戳是死的,你上去搭话,它不搭理你。流量这东西,真不真不看内容看脾气:会话到达的间隔像不像自然长出来的,浏览器行为有没有"想一想再点"的停顿,上下班有没有潮汐。这些统计特征得用行为模型现场生成,放不出来。而这笔账在2025年有了官方版。CIC-5挑战赛的征集文件里,官方自己坦白了两句话。第一句:"今天,要区分哪些痕迹是红队留下的、哪些是自动生成的,非常容易。"第二句:仿真用户扩展到50来个角色就吃力。
第二句值得停下来想。50个角色,为什么就吃力了?因为"像人"不是流量问题,是传记问题。一个可信的用户,要有自己的浏览历史、邮箱里的往来、打字的节奏、上下班的点、会犯的错误——这些东西是长出来的,不是播出来的。50个角色要写50本传记,5000个角色就是5000本,还得互相认识、互有邮件往来。背景流量的成本模型到这儿就露出了獠牙:生成流量的CPU买得起,撰写人格的工时买不起。这个死结怎么解,官方把宝押在了AI上——2026年1月,CIC-5专门办了一场"AI流量生成"评估活动。这个扣子先系在这儿,后文AI那一节再解。
对手基础设施也得单拎出来说。仿真互联网里要预置威胁行为体、僵尸网络、命令控制服务器。这里的门道是:不用红队真人上去打,而是让互联网本身就长着眼睛和牙齿。学员扫到的每一台主机背后,可能都藏着戏。这种"环境即对手"的思路,比"真人红队对真人蓝队"的老套路,成本低一个数量级,可重复性高一个数量级。演习与演习之间,环境自动重置、数据消毒——上一场的弹壳不留给下一场。
最后补一个历史坐标:PCTE早期灰空间能力的原型厂商里,有一家Metova,其CyberCENTS产品线的流量生成基于一套叫SLAM-R的技术。灰空间这个概念在美军靶场体系里的工龄,比PCTE这个项目还长——说是新发明,其实是老行当的接班人。
四、解剖台之三:镜像、快照与时间旅行
拆完网络拆存储。这一层不性感,但它是"持久"二字真正的地基。
先做个数量级的直觉题。一台预装好系统、服务和漏洞套件的训练镜像,几十GB是常态;平台上数万量级的开机实例,背后得有个PB级的"定妆照"仓库才供得起。靶场的一切场景,都是从这座仓库里点卯出兵。这座仓库里都有什么角色?官方合同文件里开过清单:操作系统从Windows XP一路排到Windows 10和Server系列,攻击平台有Kali和Parrot,邮件、域控、DNS、路由器这些配角一应俱全,连语言本地化版本都备着。从退役老兵XP到现役攻击平台Kali,随时听候调装——这是一间真正的角色库。
问题来了:一场演习拉起上千台虚拟机,难道真从仓库里复制一千份几十GB?那是几万GB的搬运,黄花菜都凉了。当然不能。这里的核心技术是写时复制:所有虚拟机共享同一份只读的母镜像,各自只挂一块薄薄的"差分盘",谁写了新数据,谁的那一页才单独落盘。一千台虚拟机同时降生,存储上真正新增的,是一千块几乎为空的差分盘,加一份大家围读的母镜像。机房一开局,全员"合影"一张,然后各演各的戏。
这套机制听着优雅,工程上却有它的死穴,行话叫"启动风暴":一千台虚拟机在同一分钟开机,同时去围读同一份母镜像,存储系统的随机读IOPS瞬间被打爆。怎么办?限流、错峰、梯队开机,都是招数,但都是治标——你把开机打散,就意味着有人要等。真正治本的招数是预热池:编排器根据预约和用量预测,提前把环境悄悄拉起来,学员点下"开始"的那一刻,做的不是"创建",是"接管"。风暴不是没有发生,而是被平移到了没人看见的夜间窗口。靶场体验的第一杀手是等待,而机器再快,也快不过提前动手。
时间尺度上给个坐标。老前辈国家网络靶场(NCR)原型期的纪录,是一天拉起1100个节点的国防部网络仿真环境;而手工搭建时代,同类环境动辄按周计。PCTE这一代编排自动化干的事,就是把"周"往"小时"这个量级继续压。环境重建从"开发商排期"压缩到"编排器排程",靶场的商业模型才算真正跑通。
更见功力的是"重置",但这里有个新手极易忽略的顺序问题。一场攻防打完,环境被轰得千疮百孔:被加密勒索的文件系统、被植入后门的域控、被改得面目全非的路由表。很多文章讲到这儿就是一句"差分盘一扔,从母镜像重新挂一块,完事"。没完事。差分盘里装着本场演习最值钱的资产:学员的每一步操作痕迹、攻击产物、评分证据、复盘素材。正确的顺序是先收割、后销毁——把证据和数据抽进评估系统沉淀下来,再让那块脏盘子进碎纸机。收割完,重置才真正"完事":母镜像永远干净,下一位学员看到的还是时间原点。所谓"一键还原",还原的不是数据,是"时间"。
"时间"这个词不是修辞,是官方术语体系里的正式概念。国防部的靶场互操作词典把"快照"定义为"事件执行状态的可存储镜像",把"检查点"定义为"创建快照、以便需要时可从快照重启执行的过程"——快照是照片,检查点是存档槽。真正科幻的在后头:CIC-4挑战赛的评估能力要求里有一行——系统评分、从检查点停止与回放、快进与快退。一场分布式演习,要能像录像带一样暂停、倒带、快进。
停下来想想这在工程上有多难。几百台虚拟机的"同一时刻"是个奢侈品:要冻结的是整个分布式系统的一致性快照——A机的磁盘、B机的内存、网络上的在途报文、恶意代码跑到一半的加密进度,都得停在同一个逻辑瞬间。否则复盘时间线就是假的:攻击者的shell比受害机的日志"早到"两秒,因果就乱了。倒带更难:不只是磁盘回滚,网络拓扑、评分状态、攻击者已建立的据点,都得跟着退回去。CIC-5进一步要求"动态保存并重启大型分布式军力级训练环境",官方用例文件里也承认:军力级演习的检查点归档数据可能非常大,且是分布式的。时间旅行的行李,是以PB计的。
行李怎么存,又是一笔分层账。热层是全闪存阵列,配40GbE网卡,伺候翻台率;任务订单里还明确提出要分析增设机械盘二级存储做长期归档——训练素材要热,证据归档要便宜,两类数据两种命。节点之间再互为备份:RCS到RCS的远程备份、内容跨节点分发回填,一套数据在地理上存好几份。
还有一样东西要单独立库:恶意代码。合同文件里有个名字很军营的设施——"恶意软件储物箱"(Malware Footlocker),管恶意代码的上传、存储、使用、部署、追踪。五个动词里,最重的是最后那个:追踪。恶意代码在靶场里是资产,资产就有台账:哪个样本、在哪场演习、被谁引爆过,全程留痕。这是把军火库的管理思路,搬进了软件仓库——危险品的每一次出库,都得有签字。
把这套账算到底,你会得出一个不太技术、非常生意的结论:镜像快照体系决定的,是靶场的"翻台率"。一家餐厅的营收上限不取决于装修,取决于一张桌子一天能翻几次台;一个靶场的产能上限不取决于仿真度,取决于一个环境一天能重置几轮、接待几拨学员。PCTE规划里反复强调的"自动化环境构建",说到底就是在给翻台率打工。
五、解剖台之四:场景即代码——剧本怎么进版本库
镜像解决了"角色"的复用,还没解决"剧本"的复用。一场演习,光有定妆照不够,还得有:网络拓扑怎么连、每台机器开什么服务留什么漏洞、背景流量按什么剧本走、红队第几小时从哪里进场、蓝队做什么动作得多少分。这一整套东西,业内叫"场景"或"想定"。
老式靶场把场景当"项目"做:一帮工程师驻场几周,手工把环境搭出来,打完就散,下次重来。PCTE这类新一代平台把场景当"代码"管:拓扑、配置、流量剧本、评分规则,全部写成结构化的描述文件,进版本库,可审查、可分支、可回滚。编排器读这份描述,像读施工图一样,自动把环境一砖一瓦搭出来——而且每次搭出来都一模一样,行话叫幂等:同一个剧本,演一百遍,布景分毫不差。这也不只是理念:任务订单的用户故事清单里,点名要用Ansible做基础设施即代码。
剧本在系统里的实体形态,官方简报里写得很具体:事件包。它有一个目录,分个人和集体两类;可以查看、可以编辑、可以克隆;从构件块组装——网络、用户、威胁三类积木;支持调度和用户分配。最关键的那个动词是"克隆":一场演习的全部知识产权,被封装成一个可以复制Fork的对象。陆军写的剧本,海军克隆一份、改两行参数就能用——跨军种共享这句口号,落到地上靠的不是觉悟,是格式。
剧本的语法也有官方词汇表。互操作词典把一场演习想定规范成这样:主场景事件表(MSEL)是总脚本,第几小时注入什么事件都列在里头;想定由若干任务线程(Mission Thread)组成,每条线程是一条贯穿的任务线;小插图(Event Vignette)则是约束想定的短场景。白队照MSEL注入事件,配合传感器和节流机制监控训练对象——CIC-3的问答里还专门补了一句:白队方案允许纳入代理、模型和AI驱动的实体行为。2019年的文件就写了这句,AI进靶场不是追热点,是早有伏笔。
学术界在同一个痛点上撞了头。热那亚大学提出过一种虚拟场景描述语言(VSDL):用约束表达场景的语义,交给SMT求解器判定可满足性,再自动生成IaaS部署脚本。他们的动机一句话就能戳中所有靶场运营者:场景寿命短、不该复用,靶场需要快速生成新场景的机制。产业界用版本库解决,学术界用求解器解决,病根是同一个——场景的瓶颈从来不是搭,是写。
"场景即代码"这步棋,初看是工程洁癖,细看是生态战略的胜负手。只有当场景变成一段可移植的文本,它才能离开作者的电脑,走进公共的内容库,被别人检索、复用、改编。后文要谈的内容运营那套玩法,底下垫的都是这块地基。没有它,内容共享就是PPT上的箭头。
六、解剖台之五:联邦——把别人的靶场接进来
PCTE不是独行侠,它只是美军"联合网络作战架构"(JCWA)里的一块积木——旁边还插着指挥控制、通用访问、统一平台、开发环境好几块。这套安排的深意在于:训练用的家伙什,必须和实战用的家伙什是同一套。
这话的分量,干过训练系统的都懂。多少训练系统死在一个"像"字上:界面像实战系统,逻辑像实战系统,唯独不是实战系统。学员在训练里练出的肌肉记忆,上了真系统全得重来。PCTE的思路是从数据结构上打通——按公开的集成路线,演习里模拟的目标资产要对得上真实目标库,威胁情报流要灌得进训练场景,恶意代码沙箱里分析出的新型样本特征,要转身变成下一场演习的检测课目。注意我用了"要"字:这些集成至今仍是持续推进的任务线,尚未毕其功于一役。这个分寸得留着——把规划说成现实,是靶场行业PPT的通病,咱们不犯。
联邦的机制得拆一层。能力开发任务订单里要求把外部靶场接进来,官方的解释原话是:可以理解为靶场间互操作,事件平面到事件平面的互操作(EP-to-EP)——具体做法,是把外部网络映射进分布式端口组。说人话:外面靶场的网络在逻辑上被并入事件平面,成为其中的一排端口。联邦的接缝不在应用层,在二层——这是老网络工程师的思路:别对协议,接线。
这个思路有家谱。JMETC用TENA中间件加JSN、JMN两张网,做分布式LVC试验做了十几年;DECRE把JIOR、CSR、NCR几个靶场联邦成过企业级环境。但国家科学院2021年那份国防靶场能力评估说了实话:现有靶场"不是为相互协作而设计的",缺乏测试并发互联杀伤链的框架与基础设施。联邦这活儿,美军自己也是半成品——这个分寸同样得留着。
顺带一提,PCTE还留了"硬件在环"的口子,外部靶场、物理测试床、工控环境都能接进来,FY2027预算里提出继续探索把OT经硬件在环纳入平台。纯虚拟仿真有个天花板:工控协议、专用硬件、真实设备的脾气,虚拟机演不出来。承认天花板并留好桥,比宣称"全虚拟包打天下"诚实得多。
七、四种打法:靶场到底拿来干什么
架构拆完了,有个问题得回头补:这套体系,到底支撑哪几种用法?PCTE的答案是四种,一层压一层。
最底下是单兵的日常保持性训练——就是维持手感那种,自定步调,像健身房里的年卡会员。往上是集体训练与认证,整支队伍拉进来,按标准课目考核,拿的是团队"上岗证"。再往上是任务预演——这一层是靶场离实战最近的地方,也是造假成本最高的地方:把真实任务的网络环境一对一复制出来,队伍在"真人真景"的复刻版里反复排练,让意外都死在演习里。复制一个真实任务的网络,比虚构十个想定都贵,但值这个价。最上面一层是院校培训,军校和训练机构的课程体系整个接进来,岗位资格要求(JQR)的培训流程在平台上跑完全程。
四层用法共用同一套底座、同一座内容库,这就解决了一个老矛盾:单兵练的场景,团队考核还能用;考核用的环境,任务预演接着改。一套资产,吃四道席。
生意也已经做到了盟友圈:PCTE向"五眼联盟"开放,澳大利亚把它整建制用作国防军网络训练的主用平台,英国、加拿大、新西兰的队伍都已进场参加联合演练。靶场这门生意,人家已经开始做"连锁加盟"了。至于并发规模,承建方放过不少响亮的数字——并发用户数千、后续几年奔着数万并发、几十万台虚拟机去——这类数字都出自厂商口径,姑且一听,咱们不拿它当论据。
八、内容运营:护城河不在砖,在菜谱
好,机器拆完了。现在说点更要命的。
我参观过不少靶场,设备清单一个比一个豪华,问一句"上个月有几场训练",场面就尴尬了。靶场这个行业最大的错觉,是把竞争力押在"场"上。其实"场"是椅子,"内容"才是戏。椅子再舒服,戏不好看,观众还是走。
PCTE在内容运营上的做法,得拆开看。
先说最显眼的一手:把内容当商品管。内容库做成可以浏览、检索、按角色推荐的货架——学员像逛商店一样逛训练内容。听着像噱头,实则直击要害:几PB的内容躺在库里,没有发现和推荐机制,等于没有。内容运营的起点不是"有什么",而是"找得到"。内容的格式也有硬约束:最新预算文件记载,已按CMI5标准引入AI辅助内容开发——CMI5是基于xAPI的课程内容互操作规范。货架上的商品,连包装规格都是标准化的。
更狠的一手,是把建场当自助服务做。Rapid Range提供快速建场能力,教员提出申请,环境自动构建。这一步的意义,在于把内容生产从"开发商特权"变成"用户日常"。原来的模式是:部队想要个新场景,打报告、走预算、等开发商排期,半年过去,威胁早换代了。现在是:教员自己上手,新想定的上线以天计,不再以半年计。内容生产的边际成本一旦降下来,内容这潭水才有可能活。
还有一手最容易被忽略:内容的"新陈代谢"。PCTE的预算文件里写得明白:训练要以威胁为牵引,跟着对手不断演化的TTP走。这句话背后的潜台词是:内容是有折旧率的,而且折旧飞快。一个不做内容代谢的靶场,三年之后就是一座网络安全的历史博物馆——展品都是真的,就是没人活在那个年代了。
至于跨军种共享——陆军建的场景海军能用,海军的课件空军能改——听着天经地义,做过跨单位协作的都懂这里面的恩怨情仇。没有顶层强制(《国防授权法案》亲自下场),没有统一的格式标准和质量门槛,共享就是一句口号。
把这几手合起来看,PCTE的内容运营,说穿了是把互联网公司那套内容平台的打法搬进了军工体系:货架得满,推荐得准,最关键的是生产的门槛得踩到地板上——让用内容的人自己生产内容。靶场同行们,抄设备清单之前,先把这套运营心法抄走。
九、AI进场:靶场终于有了"对手戏演员"
聊AI之前,先泼一盆冷水:靶场行业里"AI赋能"这个词,目前九成的用法是给PPT赋能。所以得先立个标准:AI在靶场里到底解决什么真问题?
先看官方自己的措辞,很有意思。FY2026预算文件里,AI路线写的是四件事:服务台自动化、快速建场、高级用户与流量仿真、对抗力量自动化。FY2027微调了一刀:前三件不动,第四件换成了"网络监测与报告"。两年文件对照着读,读得出两层意思:其一,四件事里三件是"让靶场更便宜地生产内容",一件是"看"——官方对AI的期待,首先是降本,其次才是对抗;其二,通篇没有"AI红队"这个词——自动化对抗力量是单列的一条线,已专门经国防创新单元(DIU)授出合同。措辞即政策,这个分寸咱们得学。
第一个真问题:红队太贵。真人红队是稀缺资源,水平高的更是天价。一支部队想搞高强度对抗,得排队等红队档期——训练频次就这么被掐死了。自动化对抗力量的意义不是取代真人红队,而是把"对抗"从奢侈品变成日用品——基层分队天天能打,真到了大演习,真人红队再出场压阵。
第二个真问题:评分靠感觉。传统演习评估,裁判拿着评分表满场转,多少带点"印象分"。智能评估工具干的是把评估从艺术变成工程。这里头有个常被外行忽略的机理,得展开讲:靶场做评估,比真实世界做检测,占了一个天大的便宜——导演知道剧本。哪条攻击链是编排器几点几分注入的、走的是哪台跳板、用的什么凭证,平台手里握着完整的"标准答案"。
但"全是客观题"这话,我只敢说一半。攻击侧确实是客观题:攻击几点几分进来、命中了哪台机器,对一对时间轴,黑白分明。防御侧就不是了——学员的处置是不是最优解,往往有多个有效答案;学员自带的工具、背景流量里的群众演员、几十个人并发操作搅在一起,把每个动作钉到具体的人头上,本身就是一场归因的苦役。所以诚实的说法是:标准答案解决的是"评分的一致性","评得对不对"这个更深的问题,还得靠客观数据加人工裁决,一层机器、一层人。
第三个真问题:想定编写太慢。一个好想定,是威胁情报、网络拓扑、剧本情节、评分规则的合金,编写门槛极高。生成式AI进场之后,"自动剧情生成"成了明牌方向:给AI喂最新威胁情报和训练目标,让它生成想定草案,人再做导演和终审。注意这个分工——AI当编剧助理,不当编剧。想定里的分寸感、对抗逻辑的自洽性,目前还得人把关。
第四个真问题,也是我最看重的:单个AI会"想简单了"。攻防对抗是博弈,博弈最怕一厢情愿。AI生成的想定,红队路线是不是太顺?蓝军响应是不是太蠢?这里的解法,是大模型多智能体:让一群智能体分别扮演红队、蓝队、普通用户、裁判,甚至专设一个"杠精评审",多路径推演、互相质询。红队智能体找到的捷径,蓝军智能体来堵;编剧智能体写的情节,评审智能体来挑刺。想定在这种"内部对抗"里滚几轮,水分就挤出去了。
再往深里走一步,说说AI红队的机理,因为这事儿没PPT上画得那么容易。
难在哪儿?难在动作空间太大、奖励太稀疏。一次完整的渗透,几百上千步操作,中间没有任何"进度条",只有最后拿到flag那一刻才知道赢没赢——这是强化学习里最硬的骨头。目前业界蹚出来的路子,是"大模型当大脑、工具当手脚、攻击图当地图":LLM负责根据当前局势规划下一步,具体的扫描、利用、横移动作交给成熟的安全工具执行,整体路径在攻击图上做剪枝。
这三件套里,最妙的一环是:靶场恰好提供了AI最缺的东西——可验证的奖励信号。在现实网络里,AI没法知道自己"做对了没有";在靶场里,每个flag的得失,评分系统立刻给出裁判。但这里我得抢在杠精前头先抬一杠:可验证不等于无偏。强化学习史上有一半的笑话,都是智能体学会了钻奖励的空子而不是学会本事——它最先发现的往往不是目标系统的漏洞,而是评分脚本的漏洞:flag文件权限配错了,环境有个确定性侧信道,赢的是靶场,不是攻防。再加上前文夸过的那句"演一百遍分毫不差",对AI训练恰恰是灾难——完全可复现的环境,鼓励背题,不鼓励泛化。所以真正的工程做法,得给环境喂随机化,给奖励加对抗性校验,练出来的战术还得拿真实威胁情报重新接地。这些啰嗦话不是煞风景,是让"飞轮"两个字站得住的脚手架。
脚手架立稳了,飞轮才转得起来:靶场训练人,也训练AI——智能体在里面练级,练出来的智能体回过头来当靶场的对手、裁判和编剧,三种角色越当越便宜,训练就越转越快。第三节留下的那个扣子,到这里也解开了:50个角色的传记写不动,是因为人写;让大模型来扮演角色种群,传记的成本就塌下来了——这是"AI流量生成"评估活动背后的真正算盘。飞轮一旦闭合,攻防双方的水平会一起被卷上去,而握着靶场的人,握着轴。
再往远看一步:当AI能扮演用户、扮演对手、扮演裁判、扮演教官,靶场的终局形态是什么?我的判断是"数字孪生训练场"——以真实网络为蓝本、持续同步演化的镜像环境。这条路上有块硬骨头:孪生体会"漂移",而且漂移不止一种。配置会漂移——新打了补丁、新接了业务、管理员随手改了设置;状态会漂移——数据内容、用户行为、业务潮汐,扫描器扫不出来;最麻烦的是语义会漂移——上周无关紧要的分支机构,这周成了任务关键地形,镜像自己不知道。
校准也不只是技术活:真实网络那侧,工控设备不让扫、加密流量看不见、托管系统进不去,观测数据先天缺胳膊少腿;把真实网络的参数往低密级的孪生体里同步,又正好撞上第二节说过的跨域钢丝。至于"误差控制在训练目标能容忍的阈值以内"——话是好话,可这个阈值怎么标定,目前全世界都没有公认答案,得老实承认这是开放问题。
把这块骨头啃下来,任务预演就不再是"像",而是"提前发生":行动前在孪生体里推演十遍,让AI对手把能想到的坑都挖一遍,真人再上。这是任务预演的终极形态。
十、挑刺:PCTE的四处暗伤
夸完了,按规矩该抬杠了。PCTE再强,也不是没有暗伤。其中几处,恰恰是国内同行最容易盲目照抄的地方。
第一处暗伤:规模的代价。数万量级的开机虚拟机、PB级内容、跨三个密级全球铺点——这套体系的运营成本高到什么程度,公开材料不会告诉你全部真相。规模带来能力,也带来惯性:架构越重,转身越慢。PCTE从传统采办转入软件采办路径,本身就说明旧模式已经拖累了迭代速度。国内靶场建设如果一开始就奔着"大而全"去,很可能还没等到规模化红利,先被运维成本压弯了腰。
第二处暗伤:评估有效性的老问题。前文说了,评分机器人解决的是"评分一致性",解决不了"评得对不对"。靶场里打出来的高分,能不能兑换成实战能力,至今没有让人信服的因果证据。更微妙的是古德哈特效应:一旦"响应几分钟"成了指标,学员就会去优化可度量的动作,而不是真实的能力——考什么练什么,练出一身应试的好武艺。这不是PCTE一家的问题,是整个训练科学的老大难——飞行模拟器有几十年的数据反哺,网络靶场才几年?对这个不确定性保持诚实,比宣称"训战一致"重要。
第三处暗伤:AI的幻觉会混进想定。大模型生成的剧情,可能编出逻辑上自洽、现实中不存在的攻击链;AI红队可能找到仿真环境本身的漏洞,而不是"真实世界"的漏洞——打赢了假靶场,输掉真战场。多智能体质询能挤出水分,但挤出的是"逻辑水分",挤不出"现实水分"。想定的最终裁判,永远是真实威胁情报和实战复盘。AI是放大器,放大的是输入的质量。
第四处暗伤,也是最隐蔽的:生态锁定。PCTE的技术栈深度绑定特定厂商的虚拟化体系,内容格式、接口标准一旦固化,后来者只能围着它转。这对美军是效率,对模仿者是陷阱——抄架构抄到最后,抄成了别人的下游。国内靶场行业真正该学的,是它的运营哲学和开放互联的思路,而不是某个具体的技术选型。
十一、结语:靶场的下半场
靶场的上半场,比的是"造":谁的仿真度高、谁的规模大、谁的并发多。
靶场的下半场,比的是"养":内容谁更新、场景谁生产、评估谁负责、AI谁训练。这门生意的护城河,正在从机房里的服务器,转移到流水线上的内容工厂,再转移到那个不知疲倦、互相抬杠的智能体集群。
对国内的靶场建设者,我只送三句话。
第一句,别把靶场当工程验收,把它当产品运营——日活比竣工报告重要。但得补一句公道话:美军靶场的日活,一半是运营出来的,另一半是制度逼出来的——岗位资格认证摆在那儿,不训练就不能上岗,训练是法定刚需,靶场不开张都不行。只抄运营哲学,不建需求牵引,食堂开得再好,也没人必须来吃饭。所以这句忠告的完整版是:一边把靶场当生意做,一边推动"不练不行"的制度上桌——生意的前提,是有人必须买单。
第二句,别把预算全砸在"场"上,内容代谢的钱一分不能省——菜谱比餐厅装修重要。
第三句,别把AI当PPT素材,让它去当那个最烦人的对手、最较真的裁判——靶场里一切不能自虐的设计,最后都会被对手帮着虐。
PCTE用十年证明了一件事:网络训练环境可以做到像空气一样,平时感觉不到,打仗离不开。这大概就是"持久"二字的全部分量。
至于我们,是先学会把食堂开好,还是继续一场接一场地办酒席——这个问题,留给每个靶场的运营者自己回答。
声明:本文来自时间之外沉浮事,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。