数据安全技术研发中心

摘要

2026年8月24日,英国信息专员办公室(ICO)发布《匿名化、假名化指南:研究专题》征求意见稿,首次以独立指南形式回应研究场景中的个人数据匿名化问题。研究专题围绕UK GDPR第84B、84C条,为研究、存档与统计(RAS)目的的处理确立“匿名优先、假名化次之”的合规阶梯,要求情境化评估再识别风险,并以TRE、TTP、合成数据等工具构建分层保障。其核心目的是把匿名化从单纯技术问题提升为可审计的数据治理体系。

背景

ICO围绕匿名化、假名化已形成多轮迭代的指引体系。早在2012年11月,ICO即出台《匿名化:管理数据保护风险行为守则》(Anonymisation: managing data protection risk code of practice,以下简称“《守则》”)。《守则》基于英国《1998年数据保护法》(Data Protection Act 1998)制定,首次将“有动机入侵者测试”(motivated intruder test)确立为重识别风险的系统化评估工具。

英国脱欧后,英国《通用数据保护条例》(UK GDPR)于2021年1月正式生效。同年,ICO启动指引编撰工作,采取分章节、分批次公开草案的模式,陆续发布《匿名化导论》《可识别性》《假名化》《问责与治理》等章节。2022年9月至12月,ICO就全部章节集中征求意见,随后将原综合指引拆分为《匿名化与假名化指南》(Anonymisation and pseudonymisation guidance)和《隐私增强技术指南》(Privacy enhancing technologies guidance)两份独立文件,并拟在前者中增设“匿名化与研究”专章。其后,受英国《数据保护与数字信息法案》(Data Protection and Digital Information Bill)立法进程影响,指南定稿工作暂缓推进。

立法环境稳定后,ICO按拆分规划推进指引发布工作。2023年6月19日,《隐私增强技术指南》先行出台;2025年3月28日,《匿名化与假名化指南》正式落地,成为现行通用指引。

但2025年《匿名化与假名化指南》并未设立研究专章,这一留白并非疏漏,而与立法节奏相关。UK GDPR原先承袭欧盟GDPR第89条,对科研、归档与统计(Research, Archiving and Statistics,RAS)目的下的个人数据处理,仅要求具备适当保障,并无额外前置要件。英国《2025年数据(使用与访问)法》(Data (Use and Access) Act 2025)修订UK GDPR,废止原第89条,新增第84A–84D条,重构RAS目的下的处理规则:

第84A条:界定RAS目的;

第84B条:明确为实现RAS目的处理个人数据,仅在以下三类情形下方可实施,且均须配套适当保障措施:(i)处理本身即属数据收集;(ii)处理将使个人数据转换为不可识别的信息;或(iii)处理为达成RAS目的所必需;

第84C条:设定保障措施的具体标准,要求不得对数据主体造成实质损害或重大困扰,不得针对特定个人作出处置,并要求落实数据最小化的技术与组织措施;

第84D条:授权国务大臣制定条例,进一步细化保障措施要求。

ICO本次发布的《匿名化、假名化指南:研究专题》(以下简称“《研究专题》”),即是在上述背景下,以2025年《匿名化与假名化指南》为基础,承接UK GDPR的更新,在匿名化与假名化领域面向研究场景的专项扩充。

主要内容及解析

01

匿名化与假名化在科研场景中的功能与作用

匿名化与假名化的层级使用与功能定位

《研究专题》明确研究数据处理应当遵循“匿名化优先、假名化兜底”的适用规则:研究开展前须优先验证匿名数据的可用性,仅在匿名数据无法支撑研究需求时,方可采用假名化方案。

《研究专题》同时说明,两类技术各有其适用价值:匿名化可消除研究对象的隐私顾虑,却有一定可能破坏数据的可用性;假名化则更适用于个体追踪、跨源数据关联、受试者身份回溯等匿名技术难以支撑的精细化场景。

研究流程中的角色识别与责任划分

鉴于科研数据处理通常构成“一系列独立但相互关联的处理活动”,同一主体在不同阶段角色不同,故须针对每个处理阶段准确识别各方的作用与责任。

《研究专题》提出,应以数据处理目的与方式的实质决定权作为判定数据控制者、数据共同控制者及数据处理者的核心依据,而非依赖形式化的合同约定。据此,委托服务商执行匿名化或假名化操作,不必然改变委托方的数据控制者地位。

02

可适用的技术与组织保障措施

技术层面,《研究专题》针对文本、语音、图像视频及传感器四类非结构化数据提出分类处理建议(见下表)。同时指出,部分高价值数据即便经过技术处理,仍难以在不显著折损研究价值的前提下彻底消除可识别性。对此,不应强行脱敏,而应承认其个人数据属性,转而以更严格的环境管控与技术措施防范风险。

组织层面,《研究专题》明确了数据保护设计与默认设置、安全措施、影响评估、员工培训及Five Safes问责框架等各项要求,并强调须建立贯穿全程的文档化机制。

03

可信研究环境搭建、运行与与机制

可信研究环境(Trusted research environment,TRE)是RAS目的下安全研究处理的重要载体,其核心机制在于将个人数据留存在受控虚拟或物理环境中,经批准的研究人员可在其中分析数据,但无法随意复制或下载原始个人数据,仅能提取经审核的汇总输出。

《研究专题》强调,使用TRE本身并不改变数据的个人数据属性,但若管理得当,其可为研究人员提供兼顾数据利用与隐私保护的安全路径,实现与匿名化、假名化技术相通的降低识别风险的目标。在此基础上,指南对TRE的建立、运营与参与作出全流程规定。

04

合成数据在科研工作中的应用方式

合成数据可在保留原始数据统计特性的同时构建全新数据集,为研究提供另一条合规路径。《研究专题》明确,合成数据虽系人工生成,但过度保留原始特征仍可能泄露个人信息,不当然属于匿名信息,并对合成数据的应用提出下列要求:

生成层面,应优先以匿名源数据或公开源数据生成合成数据,用于数据探索与可行性验证;如需保留更复杂的统计关系以支撑统计建模、假设检验、机器学习、私有AI模型开发及偏差分析等进阶研究,可由个人数据生成合成数据,但须配套更严格的访问控制与使用限制。

发布层面,合成数据的发布模式应取决于源数据可识别性、保留的原始模式、使用目的、有动机入侵者的重识别手段及各项保障措施的有效性。匿名源数据生成的,可在研究者本地以注册或开放访问等限制较少的模式发布;个人数据生成的,应在可信研究环境内发布并设访问控制与明确使用条款。

风险防范层面,应重点防范成员推断与属性披露攻击,即攻击者能否推断个体是否参与源数据或推断其敏感属性;开放访问发布时,还须防范公众误认被识别的风险,应标明数据来源与合成属性。

结语

从2012年《守则》、2025年《匿名化、假名化指南》到本次《研究专题》草案,ICO匿名化规则体系完成了三重转变:从建议性准则转向法定义务解释,从通用指引转向场景化规定,从单一测试工具转向系统性治理框架。

《研究专题》以TRE、合成数据等技术方案积极回应识别风险,为科研数据处理与跨境合作提供了直接参照。本次征求意见截止于2026年10月19日,相关机构宜据此预演合规方案,为最终规则落地提前预留调整空间。

撰稿|合规部

责编|李寅雪(实习生)卢蔷

声明:本文来自三所数据安全,版权归作者所有。文章内容仅代表作者独立观点,不代表安全内参立场,转载目的在于传递更多信息。如有侵权,请联系 anquanneican@163.com。