一、先学会忘记
十九台设备,一个标准机架,三个小时。
这是美国国家网络靶场综合体(NCRC)把一个被恶意代码糟蹋过的机架彻底洗回"什么坏事都没发生过"的时间。拆开看:交换机路由器一台十到二十分钟,戴尔服务器一台约一小时,十四台服务器并行作业约七十分钟,整机架一轮走下来,三小时。这套流程出自约翰·霍普金斯大学应用物理实验室——当年他们在DARPA的国家网络靶场项目下专门攻关这个题目,成果后来以一篇乔治·华盛顿大学博士论文的形式完整公开。
为什么把这件事放在文章开头讲?因为它点破了试验靶场这个行当最反直觉的地方:一座靶场最贵的资产,不是它能"造出"什么环境,而是它能"忘掉"什么环境。
训练靶场不懂这个道理也不要紧。学员练完,环境里留点残渣,手艺照样长在人身上。试验靶场不行。它卖出去的产品只有一样——证据。武器系统送来鉴定,考过了发证,考不过打回,规矩就一条:不发证,不许上战场。而证据有个要命的前提:得出证据的那块地,必须是干净的。上一场试验引爆的恶意代码如果还躺在磁盘某个角落,这一场测出的每个异常都要被打上问号——这到底是敌方的攻击效果,还是上一场留下的烂账?一份可能被污染的数据,在鉴定会上一分钱不值。
所以NCRC的第一哲学,是个听起来像后勤工作的词:净化(Sanitization)。当年DARPA给这个项目立难题的时候,净化和多级安全架构、快速仿真、自动化并列为四块硬骨头——注意,是并列。在一群搞尖端仿真的人眼里,"洗干净"和"仿得真"是同一个数量级的难。
难在哪?咱们把"洗"字拆开看。那不是拿个杀毒软件扫一遍。五步规程,一步一个讲究。先立信任根:你得先有一个确信没被污染过的起点,才谈得上清洗别人——洗手的先净手。然后按严格次序清洗部件:易失存储、非易失存储、硬盘、闪存,连文件系统之外的"松弛空间"都不能放过;服务器肚子里每一块固件——BIOS、带外管理卡、主板网卡、RAID卡、可信平台模块——各有各的洗法,漏一块,等于洗澡不换内衣。第三步恢复到可信状态:恢复到哪份镜像,事先就得钉死,不能洗完了现想。第四步验证:光说洗了不算数,得拿出洗过的凭据。第五步最费思量:连清洗设备本身也得清洗——拖把拖完了地,拖把自己得过一遍水,否则拖把就是最大的传染源。
这套流程跟人工净化比,时间压了一个数量级,还多了一样人工作业做不到的本事:清除驻留型恶意代码。业界通行的手艺谱系是NIST SP 800-88那份介质净化指南,处置强度分三档——清除,逻辑覆写,防键盘级对手;深洗(Purge),固件级擦除或加密擦除,防实验室级对手;销毁,物理粉碎,按通行解读防国家级对手。得说明白,"深洗"只是中间那档的名字,本文说的净化指的是把设备洗回可信净态的整套功夫,比哪一档都宽。靶场日常用中间这档:洗得掉实验室级的恢复手段,又不至于把硬件洗成耗材。
还有两个新手想不到的讲究。一个是次序:先取证,后净化。上一场引爆的未知样本、客户系统的崩溃现场,都是下一场分析要用的证物,得先请进证物库,才轮到清洗进场——现场保护永远优先于现场清理。另一个是硬件清单:虚拟机好办,镜像重灌就是;麻烦的是宿主机、带外管理口、物理交换矩阵这些角落,被恶意代码摸过之后,软件层面洗得再勤都是自欺。每一件硬件都得对应一条规程:哪些能软件复位,哪些必须固件重刷,哪些干脆列为一次性耗材。
最后这个坑是哲学级别的,我替爱抬杠的先说了:"干净"不是想证明就能证明的。准确的提法是:在明确定义的信任边界之内,净态可以验证——镜像哈希比对、重建日志审计,能把"这台机器跑的就是那份黄金镜像"变成可查验的断言;边界之外——硬件供应链有没有植入、固件里有没有沉睡的木马——你永远只能论证,不能证明。所以净化报告的本质是一纸举证书:镜像从可信来源来,重建没有漏网之鱼,核验有据可查,整条流程防得住篡改。链子的强度,就是靶场结论的强度。净化的尽头不是技术,是举证责任——这句话,国内做试验鉴定的同行值得抄在墙上。
二、考场的资格证
会"忘记"只是手艺。这门手艺为什么长在NCRC身上,得看它的户口本。
国家网络靶场(NCR)是2008年《国家网络安全综合计划》埋下的种子,DARPA从2009年起手建——这段来历前序文章《未战之地》里讲过,不重复。值得讲的是2012年10月那次过继:靶场从DARPA手里交给了国防部试验资源管理中心(TRMC),奥兰多本部长期交给洛克希德·马丁运营。这次过继定了它的终身:DARPA只管发明,运营不是它的活;而TRMC是美军全部试验鉴定基础设施的大房东——埃格林、爱德华兹、中国湖这些威名赫赫的试验基地,都在它的盘子里。进了这个户口本,NCR的身份就写死了:它不是某支部队的训练器材,是整个国防采办体系的法定检测机构。
检测机构最怕什么?怕被检测对象包养。靶场要是隶属于某个项目办公室,测出来的结论就有护犊子的嫌疑。TRMC是独立第三方,NCRC出的报告才拿得上DOT&E的桌面。国内不少靶场迟迟立不起公信力,制度上的头一道坎往往就在这——裁判员和运动员,是一个老板。
2016年前后,TRMC嫌一座靶场不够用,NCR扩容成NCRC。扩容的法子也透着精明:不在奥兰多原地加盖,而是复制——查尔斯顿、帕塔克森特河、埃格林等新址,加上夏威夷、阿拉巴马等几处区域交付点,一口靶场变成一个综合体。新节点由各军种出钱建、各军种管运营,TRMC只管统筹标准和互联。大房东出规矩,二房东们出房子。至于为什么不扩建要复制,往后看到"封装"两个字就有答案了。
三、负压病房里的战争
问一个很少想的问题:试验靶场最怕的,是"不够像",还是"不够干净"?
训练靶场选前者,试验靶场选后者。理由很硬:试验对象里有真正的网络武器和见都没见过的恶意代码,一旦漏出去,或者在两场试验之间交叉感染,靶场里每一份数据都得作废。
NCRC的答案是封装。这个机制最贴切的模样,其实是传染病医院的负压病房:每场试验住一间隔离病房——自己的计算、自己的网络、自己的存储,物理的楼体共用,病房里的空气一丝不漏到走廊上。一场试验结束,这间病房整体终末消毒,下一场重新收治。
一间隔离病房好做,难的是一整层楼同时收治毒性不同的病人。NCRC用的是MILS架构(多级独立安全):同一套基础设施上并行多场不同密级的试验。2015年的官方概述写——认证等级到TS//SI-G/TK/HCS-P//SAR这个级别,当时的能力是同开四场不同密级的试验:隔壁病房在做非密的产品评估,这间病房里正按绝密级引爆真正的网络武器,彼此之间连一个比特都不许串门。
外行看这是安全合规,内行看这是一笔经济账。一座绝密靶场的建设运维是天价,同一时间只干一件事,产能就锁死在排期表上。MILS把密级从串行的枷锁变成并行的分区:一楼同时开几间毒性不同的病房,走廊是防弹的。利用率上去了,单位试验成本才降得下来。
病房的底座是一个可重构资源池:不按试验配设备,而是养一池子通用计算、存储、网络资源,随时切分出独立的试验床。整池最大可扩展至约四万个高保真虚拟节点——官方口径随年份在四到五万之间变化——一座中等规模企业网的体量,说复刻就复刻,部署时间以小时计。
医院之间的转运通道也有讲究。连接各节点的是JMETC多级安全网(JMN),门道在分流粒度:按协议、按系统、按事件、按利益共同体把数据流分开走,非密传输走国防研究工程网,网络运营安全中心统一管控,能在任意几个站点之间隔出一片封闭病区——像病房之间的传递窗,东西递得过去,空气过不来。正式开考前还能按客户需求做接入预检:先把水电路验一遍,再收治。最后一道门是远程接入:客户不可能都搬到奥兰多上班,试验床通过这张网安全地伸到客户驻地——伸过去的是受控的访问通道,不是网络层的连通。客户看见的是自己那间病房,楼的其余部分,连存在都感知不到。
四、试验得写成一句话
封装管隔得开,净化管洗得净,还差一件事:试验本身怎么定义?
传统做法是写文档——几十页的试验方案,工程师照着手工搭环境,一步一哆嗦。当年洛马的方案走了一条最野的路:不让工程师读文档,让机器读。配套的是一套赛博科学方法(CSM)和一门赛博科学试验语言(CSTL)——这门语言2011年还发在了语义网领域的顶级学术会议上,靶场界少有的学术出身。
CSTL的讲究,值得多说一句。它不是配置脚本,是一套基于本体的形式化规约:试验目标、统计试验设计、目标网络的组成、传感器埋点位置、数据采集与分析计划,全部写成机器可以推理的声明。写成脚本的试验,机器只会照做;写成规约的试验,机器能拿通用推理机替你挑错——"你这个想定和那个测量点根本对不上"。一个是复读机,一个是校对员。
统计试验设计是它的另一根主梁。一个想定里几十个变量——操作系统版本、补丁级别、流量强度、攻击时机——全组合跑不起,得按试验设计的方法挑出代表性组合,让每个变量的贡献都能从噪声里分离出来。CSM把假设、变量、对照、复现写成规矩,CSTL把规矩变成机器可检查的字段。试验设计就此从老师傅的经验变成可辩论的对象——方案还没跑,先在规约层面被同行评审一遍。而且同一份规约贯穿设计、建场、注入、采集、分析全程,过往试验的规约还能检索、重组、复用——试验知识第一次有了可以继承的载体。
这套东西比效率更值钱的产出是两个字:复现。文档时代,同一场试验做两遍结果有出入,你永远说不清是被测系统变了还是搭环境的人手抖了;规约时代,同一份规约跑一百遍,人为搭建的差异被消掉,剩下的出入交给统计和被测对象自己去解释。到这一步,试验才算从手艺升格成科学——控制变量这四个字,在文档里是一句话,在规约里是一条铁律。
顺着"准"字再追一层:准,得有尺子。测量体系是个三层金字塔:塔尖任务效能——被攻击之后仗还打不打得赢;塔腰系统性能——防火墙拦了多少、恢复用了几分钟;塔底原始数据——每一个包、每一条日志。三层之间靠指标串着:任务效能指标管"管不管用",性能指标管"跑多快多好"。做鉴定型试验,顺序必须从塔尖倒推:先定要回答的问题,再一路往下推导要埋哪些传感器——测量点不是哪里方便装哪里,是从结论倒推出来的。
五、把考场开到武器家门口
现在可以回答那个"为什么不扩建要复制"的问题了。
看站点的选址就有讲究:帕塔克森特河是海军航空试验中心,埃格林是空军武器试验基地,查尔斯顿是海军信息战中心的地盘;夏威夷、阿拉巴马、马里兰、马萨诸塞再各设一处区域交付点,阿拉巴马那处落在管导弹的红石兵工厂,夏威夷那处在印太司令部眼皮底下。这哪是建靶场,这是往美军各大武器试验中心的家门口,各插了一根网线。
深意在于:网络试验鉴定的终极对象从来不是"网络",是"武器"。一架战斗机的航电、一套防空导弹的指挥链,没法塞进虚拟机,你总不能把飞机搬进机房。NCRC的解法是把靶场的网络延伸过去:武器系统原地不动,硬件在环接入,它对外通信依赖的整个网络世界——友军的、敌方的、民用互联网的——由靶场在旁边完整演出来。真实武器插进虚拟世界,这就是LVC联合试验的玩法。
综合体对外卖的东西,官方清单写得很有意思,叫"商品服务":部署虚拟机镜像、按规模扩展试验、规范化的事件设计、裸金属计算与存储、保证性能的硬件、事件数据存储、DNS这类基础服务。注意"裸金属"和"保证性能"这两条——虚拟化有性能抖动,做精细测量的试验要绕过虚拟化直接上物理机,性能得白纸黑字写清楚。考场卖的不只是场地,连测量条件都立了字据。
这里头还有个容易被忽略的巧思:靶场一侧还养着一座非密的靶场支持中心(RSC),几乎是主靶场的精确副本。为什么?因为试验环境的开发、集成、联调这些"装修"活,不该占用绝密靶场的档期——就像剧组不会把布景搭在正式舞台上。装修在非密区完成,验收合格,整体搬进涉密区开演。涉密产能只做涉密的事——这个道理,很多单位是花了大钱才买到的。
综合体这张网一撒,科目表就齐了:从预研验证、架构评估、安全控制评估,到合作性漏洞与渗透评估(CVPA)、对抗性评估(AA),再到恶意软件分析、任务预演。CVPA和AA是美军网络安全试验鉴定的两把主尺:前者合作开考,厂商开门配合,查漏洞查个底朝天;后者闭卷偷袭,红队按真实威胁的套路杀你个措手不及。一松一紧,量出来的才是完整的生存能力。
六、考场的日子
技术拆完,聊运营。NCRC的运营,细得像一本医院的工作规程。
一场试验在它手上,从初步接洽到收尾分析约要走七道手续:接洽、预规划、用例开发、试验设计、试验开发、试验执行、收尾分析。每个月,靶场主任和各项目经理坐下来过一遍排期表,雷打不动——与其说是科研机构,不如说是三甲医院的手术室排台。服务模式分两档:一档全包,客户只出题目,设计建场执行分析报告全由NCRC操刀;一档自助,NCRC提供验证过的环境,客户自己折腾。考场和自习室,明码标价。钱以机构出资为主:基础设施TRMC养着,客户只掏人员、差旅和被测设备钱。
成绩单很有戏剧性:2011财年开张时全年只接了1场活,2013财年8场,2016财年58场,此后逐年爬坡,累计已达数百场。抬出这条曲线的没有秘密武器,就是流水线、两档服务、月度排期这些最不起眼的笨功夫。
还有一样得敬礼:人。NCRC自己反复强调,最值钱的资产是那支多学科试验队伍——靶场设计、威胁开发、流量定制、数据分析,全得有老师傅坐镇,设备反倒排在后面。所以TRMC专门设了EPOS合同,十年期、二十多亿美元上限、多家承包商竞单,不为买设备,就为锁住这批人。设备会折旧,手艺才是考场的家底。
运营里另有一门隐形功课:考题也得保鲜。真实威胁的手法几个月一换代,考卷不跟着换,测的就是上一个时代的敌人。NCRC养着一支威胁开发力量,专干"把情报变成考题"的活:情报圈通报了新攻击手法,威胁团队把它复刻成可在靶场安全引爆的样本和想定,灌进按真实威胁搭出来的环境。这条从情报到考题的流水线,速度就是公信力——考卷总比对手慢半拍的考场,发出去的证,含金量是要打折的。
七、会学习的考生
《未战之地》谈过,AI正在把攻防两侧同时推上自动化流水线。对考场来说,麻烦更具体:AI同时从两个方向撞进来。
第一个方向:AI来考试了。武器系统里的机器学习组件越来越多,都要过鉴定这道关。传统方法论建立在一个天经地义的假设上:被测系统是确定的,同一份卷子,今天考和明天考不会变。AI把这个假设砸出了裂缝——但裂缝要分两处看。现役装备里的AI组件多采用"部署即冻结"的模式,真正的问题是版本化的回归测试:模型升一个版本,行为变了多少,新版本在统计上算不算不输给旧版本?这叫性能包络问题,难,但有章可循。真正颠覆方法论的是在线学习系统:鉴定对象从一台设备变成一条演化轨迹——你要鉴定的不再是它现在行不行,而是它学会了什么、会怎么退化、被对手在数据里下毒会怎样。第一节讲的"已知净态"到这儿也有了新含义:环境的净态好恢复,模型的净态要靠权重快照、训练数据快照、数据血统记录来定义——定义净态不难,难的是定义"行为等价"。
第二个方向:AI来当考官了。试验设计本身是多目标博弈:想定要够狠、测量点要够密、成本要够低,这活儿正适合大模型多智能体——让一群智能体分别扮演红队设计师、蓝队建筑师、成本会计和挑刺评审,把方案放在内部对抗里滚几轮,滚出来的方案比单个人拍脑袋周密。再往深一层,数字孪生加智能体等于给每场正式试验配了彩排间:先在孪生环境里把方案空跑十遍,测量点布得合不合理、数据采集有没有漏项,彩排里全暴露——正式试验从一遍过变成第十一遍过。
但先别急着鼓掌。AI生成的想定可能逻辑自洽、现实中不存在;AI考官评出来的分,可能评的是它理解的测试而不是真实的威胁。考场的铁律不会因为AI进场松动半分——结论必须可复核。AI可以出题、可以阅卷,签字画押的,永远得是能被问责的人。
八、几处问题点分析
夸完了,按规矩捅刀子。
第一处:制度性欠费。美国国家科学院2021年的评估报告把NCRC自己的警告记在了案:经费流再不建立,"要求测却不给钱"就会变成一纸无经费授权的强制任务。后果很现实:有钱的项目才测得起,穷项目带病上岗。最能说明问题的是落差——建成愿景是一年五百多场(含训练),最新预算文件口径下年执行量仍不足百场,还差着数倍。考场修得再漂亮,考生交不起报名费,公平性就是空谈。
第二处:对人的深度依赖。前面夸过手艺是家底,反过来看这就是命门:人会退休,也会被挖角。EPOS合同能锁住岗位,锁不住手艺的传承。
第三处:历史的包袱。报告里有个细节:下一代系统要跟还在跑Windows 98的老装备做兼容测试。你没看错,Windows 98。武器谱系横跨四十年,靶场必须同时演得出云原生架构和上古操作系统的脾气——"像"的债和"准"的债一起背。
第四处:考场的自我指涉。试验环境的"已知"本身就是一种偏见——你测的是你能想到的威胁,而真正的对手在考卷之外。AI时代这条裂缝还会加宽:对抗样本能迁移,靶场里的刁难未必是战场上的刁难。考场最大的风险,是考着考着,考卷自己过时了。
九、结语
NCRC用十几年证明了一件事:一个国家对网络空间的真实自信,不看它有多少攻击武器,看它敢不敢让自己的武器走进一座挑剔的考场,再敢不敢在考砸的成绩单上认账。
声明:本文来自时间之外沉浮事,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。