安全与合规
当AI开始“推断”:个人数据的边界正在被重写,企业数据架构如何应对
从希腊到加拿大,六地监管视角显示:个人数据正从“可识别个人”扩展到“可推断、可关联、可回溯”,算法输出、行为画像、生物与神经数据被纳入合规射程。
当AI开始“推断”:个人数据的边界正在被重写
导语
2026年7月,Financier Worldwide 刊发《Data privacy and protection》专题,邀请来自希腊、法国、加拿大、比利时、英国和意大利的六位数据保护与合规专业人士,围绕一个看似基础、实则决定企业架构走向的问题展开讨论:在AI系统大规模生成、推断和聚合信息之后,什么才算个人数据?
讨论呈现的核心结论是:个人数据的边界正从“可直接识别个人”扩展到“可推断、可关联、可回溯到个人”。算法输出、行为画像、生物特征乃至神经衍生数据正在被纳入或即将被纳入监管射程。对企业而言,这意味着数据隐私不再是一份可以归档的纸质合规文件,而是一组必须写进云平台、数据管道与模型生命周期的运行约束。
事件背景:一场关于“定义”的跨境讨论
这场讨论之所以值得企业技术管理者关注,是因为它揭示了一个结构性事实:个人数据的判定标准正在不同法域之间出现分化,而企业的数据流很少只停留在一个法域。
希腊方面,希腊数据保护局(HDPA)采取扩张性、动态的解释路径:算法输出与行为画像机制,只要能够实现间接识别、定向或与自然人回溯关联,就不再享有匿名地位。在欧盟《人工智能法案》框架下,监管重心明显集中在工作场所与教育环境中情绪识别系统的严格禁止上。
法国方面,法国数据保护机构(CNIL)在其2025年建议中采纳了欧洲数据保护委员会(EDPB)第28/2024号意见的立场:只要训练数据可以被提取——包括生成式系统中的“复述”(regurgitation)——模型即落入GDPR的适用范围。
加拿大的成文法定义并未正式改变,仍是“关于可识别个人的信息”,但监管机构在实践中明显扩张适用:从只关注可直接识别个人的数据,转向同时覆盖被推断和被派生出来的信息,包括行为画像、AI生成输出、生物与神经数据。
比利时并不通过单独立法重新定义个人数据,而是将GDPR与欧盟《人工智能法案》适用于新兴数据类型。比利时数据保护局(BDPA)认为,AI生成的推断结果——行为画像、评分、预测——只要与可识别的个人相关,即使来自浏览记录或语调等间接信号,也构成个人数据。
英国则缓慢转向更相对化、情境化的标准:可识别性从处理该数据的特定主体视角评估,同一信息对一个处理者是个人数据,对另一个处理者可能不是。《数据使用与访问法案》(Data Use and Access Act)与信息专员办公室(ICO)指引都反映了这一方向,尽管立法者并未将定义扩大到可能危及英国充分性认定的程度。
意大利数据保护机构 Garante 同样倾向宽泛解释:只要信息能够直接或间接促成对个人的识别、画像或单独定位,就纳入监管视野,监管关注点正从信息的技术形态转向再识别或推断的实际风险。
技术解析:从“可识别”到“可推断”的三条路径
对非技术管理者来说,理解这次边界变化,可以抓住三条技术路径。
第一,模型可提取性。 GDPR序言第26条给出的是一种功能性定义:任何能够通过“合理可能使用的手段”将个人单独识别出来的元素。EDPB第28/2024号意见与CNIL的2025年建议把这一标准延伸到生成式模型内部——如果训练数据可以被反向提取出来,模型本身就受GDPR约束。技术上,这意味着“我们只存了权重,不存原始数据”不再是一个自动成立的抗辩理由。
第二,自动化推断的效力。 2023年的Schufa案中,欧盟法院(CJEU)裁定:当第三方“高度依赖”某个自动化概率评分来确定合同结果时,该评分构成GDPR第22条意义上的决定。比利时BDPA进一步明确,AI得出的分数本身不具备证明价值,任何具有法律意义的决策之前,都必须经过有意义的人工复核。希腊HDPA则指出,单纯的假名化不足以排除再识别风险,因此由算法预测和神经衍生洞察产生的数据构成个人数据,需要依据GDPR完成强制性的数据保护影响评估(DPIA)。
第三,生物特征与神经数据的特殊地位。 生物特征数据依据GDPR第4条第14款和第9条第1款属于特殊类别数据,法国CNIL自2019年起将这一保护延伸至由原始生物特征派生、但原始数据无法重建的算法输出。比利时宪法法院在2025年1月确认,人脸识别需要严格的比例性、明示同意以及使用后的立即删除。神经衍生数据则是下一个前沿:虽然尚未被列入GDPR第9条,欧洲委员会T-PD委员会已于2025年发布草案指引,将《108号公约》升级版原则适用于神经数据。
用一句话概括:数据是“匿名”还是“个人”,不再取决于它长什么样,而取决于它能否被关联回去、被用来做决定。
企业影响分析
成本影响:CAPEX与OPEX的双向抬升
合规要求的技术化会同时抬高资本支出与运营支出。资本支出体现在数据分区、区域化训练与推理环境、审计日志基础设施、数据血缘与删除能力的建设上;运营支出则体现在持续的DPIA、模型可提取性评估、人工复核岗位与跨法域数据流映射上。
执法数据解释了这种成本为何难以回避。法国CNIL在2025年开展了323次检查,作出83项处罚,合计近4.87亿欧元,其中67项通过2022年引入的快速通道程序完成——这意味着处罚周期在缩短。比利时BDPA在2024年新立案157件,同比增长83%,罚款总额708,371欧元,其中包括对一家数据经纪商174,640欧元的处罚以及对IAB Europe 250,000欧元的处罚。
部署与运维影响:合规前置到架构层
当“推断结果即个人数据”成为监管共识,合规就无法在应用层事后补救。企业需要在架构层面回答几个问题:训练数据在哪一区域落地、推理结果是否跨境流动、数据主体权利请求能否在技术上被真正执行、模型输出能否被回溯到具体的数据来源。
英国的实践还提示了另一种复杂度:可识别性可能因处理者而异,这意味着同一份数据在不同业务单元、不同云环境中可能拥有不同的法律属性,数据目录与权限模型需要具备相应的颗粒度。
安全与合规影响:泄露通知成为执法入口
多地的数据都指向同一趋势——泄露通知不再只是履行义务,而是执法的入口。法国2025年的泄露通知达6167起,同比约增长10%,而第32条安全措施不足仍是最主要的执法依据之一。比利时2024年的泄露通知为1455起,同比增长13%,勒索软件攻击处于积极调查之中;BDPA还会常规性向控制者发出后续问询,要求说明评估泄露风险等级所采用的方法。
诉讼风险同步上升。加拿大的集体诉讼如今经常紧随重大泄露事件而来,企业需要同时管理监管风险与诉讼风险。比利时2024年有10起上诉提交至布鲁塞尔市场法院,其中6项裁决被部分或全部撤销;更值得关注的是,市场法院已确认,单次事件可以触发对整个组织的全面GDPR审计。
市场竞争分析
这一变化正在重新分配云计算与数据产业链上的议价能力。
云厂商方面,数据驻留与区域化处理能力从“加分项”变成“准入项”。当模型的可提取性、跨境数据流的可追溯性、数据主体权利的可执行性成为合同条款的一部分,能够提供更强数据分区、更细粒度审计与本地化处理选项的云平台,将在受监管行业客户的招标中占据优势;反之,跨国统一架构的简化叙事会遭遇阻力。
数据经纪与广告技术领域承压最明显。比利时对数据经纪商的处罚以及对IAB Europe的处罚,说明依赖间接信号构建画像的商业模式正处于监管高关注区。
企业SaaS方面,AI功能默认开启的数据处理条款将受到更严格审视。当行为推断被认定为个人数据,SaaS厂商需要在产品设计中提供可解释的推断逻辑与可关闭的数据路径,否则会把合规风险转移给客户。
AI基础设施方面,训练数据可提取性将直接影响模型发布策略。“已匿名化”这一说法在营销与合规文件中的可用性正在下降,模型卡、数据来源说明与可提取性测试有可能成为模型交付的标准附件。
行业趋势观察
第一,从纸质合规走向运营就绪。专题中反复出现的判断是,企业需要的是基于运营准备度的务实方法,而不是对文件的依赖。DPIA、人工复核、可提取性测试这些动作,本质上是把合规变成工程实践。
第二,可识别性标准的相对化与情境化。英国正在推进的相对标准,以及CJEU在EDPS诉SRB案中重新引入的主观标准,都在暗示一种可能:匿名性可以是条件性的、情境性的,而非数据本身的固有属性。
第三,主权化与区域化将持续渗透基础设施层。当数据属性取决于处理主体与处理环境,云架构的设计自由度会被合规边界重新切割。
第四,执法从偶发走向结构化计划。CNIL从零散案件转向系统性检查计划、比利时从被动受理投诉转向主动系统性审查,说明监管能力本身正在工业化。
CloudTechDaily Insight
这次讨论最重要的意义,不在于某个法域是否重新定义了个人数据,而在于监管逻辑的底层假设发生了位移:判断一份数据是否受保护,不再看它的形态,而看它能否被关联、被推断、被用于做决定。对AI系统而言,这是一个难以用技术手段“绕过”的标准,因为它考核的是系统能力,而不是数据存储方式。
对企业IT战略的直接含义有三点。其一,数据治理必须从应用层下沉到平台层,数据分区、血缘追踪、区域化推理与删除能力应当作为云架构的一等公民来设计,而不是在合规审计前临时补齐。其二,AI功能的上线流程需要嵌入合规判断节点:训练数据来源是否可提取、推断结果是否会被用于具有法律意义的决策、是否保留了有意义的人工复核,这些问题的答案应在架构评审阶段而非事故之后给出。其三,成本模型需要重估。法国的处罚规模与快速通道机制、比利时单次事件触发全面审计的先例,都意味着合规失败的期望损失正在上升,而把合规能力做成可复用的平台能力,是少数能够同时降低风险与长期运营成本的路径。
对云计算产业而言,最值得关注的长期启示是:隐私合规正在从法律部门的议题,变成基础设施产品力的组成部分。谁能把区域化处理、可验证的数据治理与AI治理能力做成默认可用的平台能力,谁就更有可能在接下来的企业AI采购周期中,把合规从成本中心转化为竞争壁垒。
参考链路 · cloudtechdaily
cloudtechdaily 将这段说明放在「云平台 / 关注公有云平台、区域发布、价格变化、伙伴生态以及企业上云迁移策略。 / 数据中心」的站点语境中: 日期、名称和状态变化仍需重新核对。「云平台 / 关注公有云平台、区域发布、价格变化、伙伴生态以及企业上云迁移策略。 / 数据中心」解释了本文的本地编辑角度;读者复用摘要前应先打开来源链接。