PrivFusion:一种用于协调分布式数据集的隐私保护多智能体框架

arXiv cs.LG 论文

摘要

PrivFusion 是一个隐私保护的多智能体框架,可在联邦训练之前自动协调跨机构的结构化数据集,从而减少人工工作量,并实现对敏感临床数据的协作分析。

arXiv:2605.24249v1 公告类型:新 摘要:临床数据的日益可用性推动了机器学习的广泛应用,然而,对于敏感的健康信息,集中式数据聚合往往不可行。联邦学习提供了一种分布式替代方案,但其应用受到机构数据集之间显著异质性的限制,使得协调成为多站点分析的一个关键但经常被忽视的前提条件。我们提出了 PrivFusion,这是一个隐私保护的多智能体框架,可在联邦训练之前自动协调结构化数据集。PrivFusion 使用智能体分析本地数据,跨站点聚类语义相似的特征,并提供迭代的转换建议,直到实现对齐。在四个异构 COVID-19 数据集上的评估表明,PrivFusion 能够有效且高效地协调多站点数据,同时大幅减少人工工作量。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:02

# PrivFusion:一种用于协调分布式数据集的隐私保护多智能体框架
来源:https://arxiv.org/html/2605.24249

###### 摘要

临床数据的日益丰富推动了机器学习应用的普及,但对于敏感健康信息而言,集中式数据聚合往往不可行。联邦学习(FL)提供了一种分布式替代方案,但其应用受到机构数据集间显著异质性的限制,使得协调成为多地点分析中一个关键但经常被忽视的前提条件。我们提出PrivFusion,一种隐私保护的多智能体框架,可在联邦训练之前自动完成结构化数据集的协调。PrivFusion利用智能体分析本地数据,跨站点对语义相似的特征进行聚类,并提供迭代的转换建议,直至实现对齐。在四个异质性COVID-19数据集上的评估表明,PrivFusion能高效、有效地协调多站点数据,同时大幅减少人工工作量。

## I 引言

临床、生物医学和公共卫生领域生成的数据量和复杂性持续快速增长。这推动了机器学习(ML)方法在风险预测、表型分析和队列发现等任务中的应用[6 (https://arxiv.org/html/2605.24249#bib.bib47)]。然而,传统的ML流程通常依赖集中式数据聚合,对于电子健康记录或财务数据等敏感信息而言,由于隐私、安全和治理约束,这种聚合往往不可行。因此,许多医疗机构仍然无法或不愿共享原始数据,限制了大规模、多地点分析的机会。

联邦学习(FL)作为一种替代方案出现,使得机构间能够在数据留在本地的情况下进行协作模型训练[3 (https://arxiv.org/html/2605.24249#bib.bib48)]。尽管FL在多个领域展现出巨大潜力,但在现实世界中部署FL仍面临挑战。一个核心障碍是机构间的数据异质性。临床数据集在特征定义、编码系统、粒度、测量实践和数据质量上往往存在差异。在进行任何分布式分析之前,这些数据集必须被协调——这是一个劳动密集型的过程,需要对齐变量、解决语义不一致性以及标准化表示[20 (https://arxiv.org/html/2605.24249#bib.bib45)]。然而,大多数FL方法学隐含地假设协调在模型训练之前已完成,这一假设并不现实。因此,这成为了一个主要瓶颈,延缓或限制了联邦研究的可扩展性。

为缓解这些挑战,一些研究探索了基于本体和语义的数据协调技术[19 (https://arxiv.org/html/2605.24249#bib.bib49),5 (https://arxiv.org/html/2605.24249#bib.bib50),10 (https://arxiv.org/html/2605.24249#bib.bib51)]。虽然这些方法缓解了数据异质性的某些方面,但它们通常需要一定程度的集中化,或依赖预定义的通用形式化和映射,这在具有不同工作流和数据模型的机构之间难以建立。这些局限性凸显了在分布式环境中无需集中敏感数据即可自动、可扩展且隐私保护的协调方法的需求。这样的能力将大幅减轻参与机构的手工负担,拓宽协作分析的渠道,并最终提高所得模型的泛化能力。

为解决这一空白,我们提出PrivFusion¹,一个隐私保护的多智能体框架,旨在联邦模型训练之前协调跨机构的结构化数据集。在PrivFusion中,每个参与站点(研究者)首先使用一组智能体对其数据集进行本地分析,提取数据类型、生成数据集和特征级描述、推断特征间关系,并生成少量合成样本。然后各站点将这些元数据共享给一个中央服务器(聚合器)。服务器利用接收到的元数据将跨数据集语义相关的特征聚类,并基于这些聚类调用另一个智能体为每个站点生成协调建议。这些建议指定哪些特征需要转换以及对齐所需的目标表示。每个站点本地应用建议的转换,然后将更新后的元数据重新发送给服务器。此迭代过程持续进行,直到不再需要额外的转换。我们在四个来自不同国家的真实世界COVID-19数据集上评估了PrivFusion,发现即使在底层大语言模型(LLM)变化的情况下,它通常能在2–3次迭代内实现数据集对之间的协调。我们还观察到特征名称相似性在连续迭代中持续增加,表明模式逐渐收敛。

## II 系统模型与威胁模型

在本节中,我们介绍系统模型和威胁模型。

**系统模型。** 我们考虑一个包含两方的系统:(i) 两个或多个研究者,以及 (ii) 一个服务器。研究者的目标是使用高质量数据协作训练一个医学诊断模型。为此,他们需要确保数据以隐私保护的方式协调。所有计算都外包给服务器。为了协调数据集之间的特征,每个研究者向服务器提供一些元数据(如第III节 (https://arxiv.org/html/2605.24249#S3) 所述)。服务器利用接收到的元数据,为每个数据集确定哪些特征需要转换以及目标表示,并将这些建议发送给每个研究者。研究者根据接收到的建议转换其数据集,然后进行期望的研究。

**威胁模型。** 我们假设研究者是诚实的,持有合法研究数据集,处于“诚实但好奇”的设定中:服务器遵守协议,但可能利用共享的数据和元数据推断数据集中个体的敏感信息。一些已知的攻击包括成员推断攻击[23 (https://arxiv.org/html/2605.24249#bib.bib17),2 (https://arxiv.org/html/2605.24249#bib.bib19)]和属性推断攻击[14 (https://arxiv.org/html/2605.24249#bib.bib18)]。在成员推断攻击中,攻击者(服务器)试图判断目标个体是否在数据集中。在属性推断攻击中,攻击者的目标是基于观察到的信息推断目标个体的额外敏感信息。

## III 提出的框架

为了协调不同数据集之间的特征,提出的方法要求研究者以隐私保护的方式与服务器共享关于其数据集和样本的信息。研究者的目标是提供有助于确定所需数据集转换的元数据。同时,他们希望确保元数据不会增加共享数据集聚合统计信息的基线隐私风险。令S表示服务器,D^i表示研究者R^i的原始数据集,M^i表示每个研究者发送给服务器的元数据。下面我们描述所提出框架的不同步骤,如图1 (https://arxiv.org/html/2605.24249#S3.F1) 所示。

参考图注:图1:PrivFusion概览。

**数据集分析器。** 最初,每个研究者本地提取其数据集的特征数据类型(例如,字符串、数值、单精度浮点数等)。此外,每个特征通过先进的数据分类技术[22 (https://arxiv.org/html/2605.24249#bib.bib13),4 (https://arxiv.org/html/2605.24249#bib.bib14)]以及映射到选定通用本体中的语义概念来关联一个语义类型。我们使用DBPedia作为参考本体。之后,研究者使用智能体A_D生成数据集的描述。给定数据集描述和特征数据类型,每个研究者使用另一个智能体A_F获取特征的语义描述。此外,每个研究者使用智能体A_T提取其数据集D^i中表示的相关主题列表。为了识别特征依赖性,他们使用智能体A_R推断特征之间的关系。最后,每个研究者生成n个合成样本,这些样本保持低效用,主要指导服务器在后续步骤中跨数据集协调特征。研究者的目标是生成在其各自数据集中保持特征格式并在域内取值的合成样本。注意,为了生成合成样本,研究者可以使用任何SOTA差分隐私(DP)方法。

在此阶段结束时,每个研究者生成一个元数据M^i,包括:(i) 数据集描述,(ii) 特征名称和数据类型,(iii) 单个特征的语义描述,(iv) 数据集主题列表,以及 (v) 推断的特征间关系。此外,每个研究者共享n个合成生成的样本。每个研究者R^i将其准备好的元数据M^i发送给服务器S,服务器确定哪些特征需要转换及其粒度,然后将此信息发送回研究者。

**特征聚类。** 通过检查元数据M^i(特别是特征名称、数据类型和语义类型),服务器将跨数据集的特征进行聚类,将语义相似或相关且可能合并为单一特征的特征分组。这通过智能体A_C完成,它聚类共享相似语义且适合合并的特征。该智能体输出一组聚类C,其中每个聚类C_j包含一个聚类标识符、特征名称及其数据集名称。同一聚类中的特征共享一个聚类ID,表明跨数据集的潜在对齐。因此,聚类包含一个或多个特征。

**转换推荐器。** 给定上一步获得的聚类以及每个研究者提供的元数据M^i——特别是数据集描述、特征语义类型(即DBpedia URI)和语义描述、特征关系以及合成样本——服务器调用另一个智能体A_H来确定每个数据集中哪些特征应合并、删除或修改。对于每个聚类,A_H比较DBpedia URI和语义特征描述,以收敛到一个最能反映跨数据集共享概念的同时保持适当粒度级别的代表性DBpedia URI。结果是每个研究者的一组转换建议,指定哪些特征需要修改以及目标表示,服务器S将这些发送给相应方。

**应用转换。** 收到转换指令后,每个研究者R^i将其应用于自己的数据集。研究者可以直接使用Python脚本实现这些转换,或利用代码生成LLM M_C自动生成转换函数。一旦应用转换,所有参与数据集将协调为共同的语义和结构格式。这种对齐使得机构间能够协作开发和训练高质量的诊断模型。这些步骤重复进行,直到服务器不再建议进一步的转换或达到最大迭代次数T。

## IV 评估

我们对PrivFusion的评估聚焦于两个关键方面:(i) 达到收敛所需的迭代次数,以及 (ii) 协调过程中推荐的特征级转换数量。我们测量每次迭代时数据集之间的特征相似性以展示协调进展,并考察底层LLM的选择如何影响这些结果。

**数据集。** 我们使用四个公开的COVID-19数据集:(i) COVID-19 印度尼西亚² (IDN),(ii) COVID-19 阿富汗³ (AFG),(iii) COVID-19 意大利⁴ (IT),以及 (iv) COVID-19 美国⁵ (US)。每个数据集包含指定国家的COVID-19病例信息(例如,特定日期特定地点的冠状病毒病例总数)。这些数据集共享一些不同表示的特征,如日期、ISO代码、地点等。注意,我们从AFG和IDN数据集中移除了一些唯一特征,以便将分析集中在可能对齐的特征上。

**日期。** 所有四个数据集都包含日期特征,但使用不同的格式。IDN记录日期为 mm/dd/yyyy(Date),而AFG和US使用格式 yyyy-mm-dd(date)。IT提供最详细的表示,遵循ISO-8601时间戳格式 YYYY-MM-DDTHH:MM:SS(date)。

**地点。** 地点粒度和编码差异很大。US报告县和州级别的标识符。IDN使用ISO代码(Location ISO Code)和省级别标签(Location)。AFG使用三个特征描述地点:iso_code、continent和location。IT提供最细粒度,包括 Country、RegionCode、RegionName、ProvinceName、ProvinceAbbreviation、Lattitude、Longitude。

**病例数。** 所有数据集报告COVID-19病例总数,但特征名称不同:TotalPositiveCases(意大利)、cases(美国)、total_cases(阿富汗)、Total Cases(印度尼西亚)。

表 I:从阿富汗、印度尼西亚、意大利和美国的COVID-19数据集生成的合成样本。
(a) COVID-19 阿富汗
(b) COVID-19 印度尼西亚
(c) COVID-19 意大利
(d) COVID-19 美国

表 I (https://arxiv.org/html/2605.24249#S4.T1) 展示了从每个数据集生成的合成样本快照。对这些样本的简要检查表明,尽管存在多个概念上对齐的特征,协调它们需要大量的预处理。对齐语义等价的列涉及从简单操作(如标准化特征名称,例如将 Date 转换为 date)到更复杂的任务(如聚合多个与地点相关的特征并选择一致的粒度级别,例如将省份级信息降级为国家级别)。这些挑战突显了需要一种基于推理的对齐过程,能够解释语义含义,而不仅仅依赖字符串匹配或手动规则。此外,表示格式的差异,如ISO代码或GPS坐标,需要额外的数据处理。

相似文章