高效去中心化多任务数据集估值:基于模型合并的方法

arXiv cs.CL 论文

摘要

论文提出了DMVM,一个去中心化多任务数据集估值框架,利用任务算术和模型合并来估计数据集贡献,无需重新训练或数据共享,为数据市场实现可扩展且保护隐私的估值。

arXiv:2607.03346v1 公告类型:新 摘要:准确高效的数据集估值对于实现公平透明的数据市场至关重要,尤其是在多个贡献者为训练多任务模型提供数据时。然而,大多数现有估值方法仅限于单任务场景,忽略了买方旨在优化多个下游任务性能的情况。此外,传统的估值方法(如基于Shapley值或重新训练的方法)计算成本高,且不适合没有可信中央协调器且隐私约束严格的去中心化环境。我们提出了DMVM(通过模型合并实现去中心化多任务估值),这是一个新颖框架,通过利用任务算术直接从模型组合中推断数据集贡献,避免了重新训练和数据共享。DMVM不进行重新训练或共享原始数据,而是量化在不同数据集上训练的模型在参数空间中如何组合,以推断每个数据集在多个任务中的边际效用。这种公式化产生了一个可扩展、计算高效且与多任务泛化行为明确一致的估值过程。为了支持去中心化部署,我们引入了一个安全聚合协议,使得在不暴露单个模型参数或私有数据的情况下进行协作估值。我们还提供了理论误差界来描述DMVM的近似质量,并通过计算机视觉和自然语言处理任务的综合实验验证了我们的框架。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:37

# 面向高效去中心化多任务数据集估值的模型合并方法 来源:https://arxiv.org/html/2607.03346 Mohammadsajad Alipour 计算机科学系 伦斯勒理工学院 美国纽约州特洛伊市 12180 alipom@rpi\.edu&Mohammad Mohammadi Amiri 计算机科学系 伦斯勒理工学院 美国纽约州特洛伊市 12180 mamiri@rpi\.edu ###### 摘要 准确高效的数据集估值对于实现公平透明的数据市场至关重要,尤其是在多个贡献者为训练多任务模型提供数据的情况下。然而,大多数现有估值方法仅限于单任务场景,忽略了买方希望优化多个下游任务性能的情形。此外,传统的估值方法(如基于Shapley值或基于重新训练的方法)计算成本高昂,且难以适用于没有可信中央协调者且具有严格隐私约束的去中心化环境。我们提出DMVM(通过模型合并实现去中心化多任务估值),这是一个新颖框架,它通过利用任务算术直接从模型组合中推断数据集贡献,从而避免了重新训练和数据共享。与重新训练或共享原始数据不同,DMVM量化了在不同数据集上训练的模型在参数空间中的组合方式,以推断每个数据集在多个任务上的边际效用。这种公式化产生了一个可扩展、计算高效且明确符合多任务泛化行为的估值过程。为了支持去中心化部署,我们引入了一个安全聚合协议,该协议能够在不暴露单个模型参数或私有数据的情况下实现协作估值。我们还提供了理论误差界来刻画DMVM的近似质量,并通过在计算机视觉和自然语言处理任务上的全面实验验证了我们的框架。 ## 1 引言 数据集估值已成为现代数据市场设计中的核心挑战。在数据市场中,多个卖家提供专有数据集,而买方则希望提高特定目标任务上的模型性能。在购买前准确估计卖家数据的价值对于公平定价、明智决策以及维持市场信任至关重要。这种估计旨在量化数据集为特定任务的学习算法提供的边际效用,从而指导买方进行高影响力的采购,并激励卖家贡献高质量数据。

先前的工作在形式化数据估值问题上取得了实质性进展。博弈论方法如Data Shapley[21 (https://arxiv.org/html/2607.03346#bib.bib24)]通过平均所有数据子集上的边际贡献,提供了理论原则性的度量。影响函数技术估计训练样本对模型预测的影响[31 (https://arxiv.org/html/2607.03346#bib.bib54),73 (https://arxiv.org/html/2607.03346#bib.bib53)],而基于梯度的方法(例如,强化学习或效用代理)则试图捕捉数据集与目标任务的对齐程度[69 (https://arxiv.org/html/2607.03346#bib.bib55),6 (https://arxiv.org/html/2607.03346#bib.bib28)]。虽然这些方法在理论上具有吸引力,但在应用于真实世界数据市场时面临着关键障碍,如下所述。

实际部署的一个主要障碍是计算开销:估计边际贡献,尤其是通过基于Shapley值的方法,通常需要在指数级数量的数据集组合上重新训练或微调模型。这在规模较大时变得不可行,特别是对于大型模型或大量卖家而言。第二个挑战是数据隐私。大多数估值技术假设集中访问原始数据,这在许多涉及敏感或受监管数据集(例如,医学成像或个人数据)的真实世界市场中是不现实的期望。在这种情况下,即使出于估值目的,卖方也不太可能允许共享原始数据。除了可扩展性和隐私之外,第三个常被忽视的局限性是对单任务估值的狭隘关注。大多数现有方法评估数据集相对于单个预定义任务的效用。然而,在实际环境中,买方通常追求多任务学习目标(例如,同时执行检测和分割的多任务视觉模型,或执行情感分析、主题分类和摘要的多任务语言模型)。多任务学习背景下的估值本质上更为复杂,因为数据集的效用可能因任务而异,并且其价值无法通过单一性能指标来捕捉。尽管多任务模型在实践中越来越重要,但针对这种设置的数据集估值研究很少,留下了重大的方法论空白[2 (https://arxiv.org/html/2607.03346#bib.bib60),75 (https://arxiv.org/html/2607.03346#bib.bib62)]。

与此同时,模型合并最近作为一种策略出现,用于组合在不同数据集上微调的模型,而无需访问或重新训练组合数据[25 (https://arxiv.org/html/2607.03346#bib.bib25),63 (https://arxiv.org/html/2607.03346#bib.bib68),41 (https://arxiv.org/html/2607.03346#bib.bib79),62 (https://arxiv.org/html/2607.03346#bib.bib40),3 (https://arxiv.org/html/2607.03346#bib.bib47)]。从一个共同的基座开始,模型独立微调;它们的参数更新(通常表示为任务向量[25 (https://arxiv.org/html/2607.03346#bib.bib25)])然后通过平均、插值或更高级的技术(如任务向量修剪或平衡)进行合并,以近似联合训练的效果[67 (https://arxiv.org/html/2607.03346#bib.bib26),70 (https://arxiv.org/html/2607.03346#bib.bib81)]。经验上,Tao等人[56 (https://arxiv.org/html/2607.03346#bib.bib7)]表明,合并在不同数据集上微调的模型可以紧密近似在组合数据上训练的模型的性能。他们进一步展示了合并模型的准确性与在全数据混合上训练的模型的准确性之间存在强线性相关性,表明模型合并可以作为混合微调或多任务学习的高效可靠代理。此外,Zhou等人[74 (https://arxiv.org/html/2607.03346#bib.bib51)]通过推导通过多任务学习训练的模型权重与通过任务算术合并的模型权重之间的误差界,为这种直觉提供了理论支持。

在多任务设置中,评估数据集价值的理想方法是衡量其对联合训练的多任务模型的边际改进;也就是说,当所有任务联合优化时,它贡献了多少性能增益。然而,这种联合训练在去中心化市场中计算上是禁止的,因为它需要访问所有数据集并在卖家组合上重复重新训练。为了克服这一瓶颈,我们从模型合并的最新进展中汲取灵感,模型合并可以近似联合多任务训练的效果,而无需在组合数据集上训练的成本。从一个共享的初始化开始,模型独立地在各个数据集上进行微调,它们的参数更新(通常表示为任务向量)通过参数空间中的算术运算进行组合。经验和理论研究表明,这个过程可以紧密复制真实多任务学习的结果[35 (https://arxiv.org/html/2607.03346#bib.bib50),25 (https://arxiv.org/html/2607.03346#bib.bib25),74 (https://arxiv.org/html/2607.03346#bib.bib51),43 (https://arxiv.org/html/2607.03346#bib.bib59)],表明模型合并可以作为评估跨任务贡献的高效代理。

基于这一洞察,我们引入了DMVM(通过模型合并实现去中心化多任务估值),这是一个通过模型合并的视角来形式化多任务数据集估值的框架。DMVM通过分析数据集对应的模型如何影响买方目标任务上的聚合性能来估计每个数据集的边际效用。我们的公式化能够实现完全去中心化的估值,无需原始数据交换;纳入了一个隐私感知协议,以在估值过程中保护单个模型;并提供了一个理论误差界,刻画了基于DMVM的估值与真实多任务估值之间的近似差距。我们通过在去中心化数据市场的模拟来验证我们的框架,显示了在视觉和语言基准测试中一致的价值估计。我们的主要贡献是:

- •**高效且去中心化的估值框架。**我们引入了DMVM,一种通过模型合并进行多任务数据集估值的新方法。它无需重新训练或集中访问数据,能够实现完全去中心化的部署,无需可信的经纪人或多方。
- •**隐私感知协议。**DMVM包含一个安全聚合协议,能够在不暴露原始数据或单个模型的情况下实现协作估值,确保与隐私敏感应用的兼容性。
- •**理论保证。**我们推导了误差界,刻画了DMVM相对于真实多任务边际贡献的近似质量。
- •**经验评估。**我们在代表性的视觉和语言基准测试上展示了DMVM稳定可靠的估值性能。

通过连接数据集估值和模型合并领域,DMVM为多任务市场中的数据集估值建立了一个可扩展、隐私感知且具有理论基础的基石。

## 2 相关工作

数据驱动机器学习的普及创造了对数据经济价值进行量化的需求,既为了公平补偿贡献者,也为了高效获取新的高质量数据。这一研究领域可以大致分为评估单个数据点的方法、评估整个数据集的技术以及数据市场的设计和运作。

**数据估值:评估单个数据点。**数据估值的一种主导方法是Shapley值[51 (https://arxiv.org/html/2607.03346#bib.bib82)],这是合作博弈论中的一个概念,它基于每个数据点对所有可能数据子集的机器学习模型性能的平均边际贡献,公平地分配其价值[21 (https://arxiv.org/html/2607.03346#bib.bib24)]。这种方法在公理上是公平的,满足对称性和可加性等性质。标准Data Shapley的主要缺点是其指数级计算复杂度,$O(2^N)$,这对于现代规模的$N$个数据点数据集来说是禁止的。为了克服这一点,已经开发了几种近似方法[28 (https://arxiv.org/html/2607.03346#bib.bib21)]。基于采样的方法通过采样数据的随机排列来估计Shapley值,但可能仍然需要大量的模型重新训练[21 (https://arxiv.org/html/2607.03346#bib.bib24),40 (https://arxiv.org/html/2607.03346#bib.bib22)]。Jia等人[27 (https://arxiv.org/html/2607.03346#bib.bib45)]提出了一种专门用于K近邻模型的精确高效算法来计算Shapley值,将复杂度降低到$O(N\log N)$。最近的工作进一步将基于Shapley的估值扩展到图结构数据[11 (https://arxiv.org/html/2607.03346#bib.bib30),55 (https://arxiv.org/html/2607.03346#bib.bib29)]。

**数据集估值。**虽然点级估值支持数据整理和调试,但数据集估值解决的是整个贡献者的数据集在数据所有者之间的合作博弈中增加了多少效用。这一系列工作侧重于将整个数据集作为一个单一单位进行估值,这与聚合单个数据点的价值不同。Shapley值也可以应用于数据集级别,衡量一个卖家的整个数据集对另一个卖家联盟的边际贡献。为了解决计算成本问题,提出了DU-Shapley[19 (https://arxiv.org/html/2607.03346#bib.bib8)]作为专门用于数据集估值的高效代理,它使用离散均匀近似,比通用蒙特卡洛采样更高效。另一条研究路线是与任务无关的数据集估值方法,这些方法不依赖特定模型或验证集来评估数据,从而避免了验证数据不可用等问题。相反,它们基于数据集的内在分布属性来估计价值。PriArTa框架通过计算买方和卖方数据集的增强不变潜在分布之间的Wasserstein距离来评估卖家[26 (https://arxiv.org/html/2607.03346#bib.bib9)]。另一项相关研究引入了一个基本的估值框架,通过两个互补指标来表征数据集:相关性(捕捉统计相似性)和多样性(捕捉统计差异)[4 (https://arxiv.org/html/2607.03346#bib.bib10)]。这些指标通过比较数据集的二阶矩属性来估计,可以通过仅共享主成分来私下进行。这种方法后来被扩展到图数据[18 (https://arxiv.org/html/2607.03346#bib.bib23)]。

**数据市场。**越来越多的研究探索数据市场的设计和经济原理。构建这样的市场具有挑战性,因为数据具有独特的特性:它们可以以近乎零的成本复制,其价值源于数据集之间的复杂交互,并且其对给定任务的实用性事先难以评估[37 (https://arxiv.org/html/2607.03346#bib.bib44),57 (https://arxiv.org/html/2607.03346#bib.bib27),10 (https://arxiv.org/html/2607.03346#bib.bib33),7 (https://arxiv.org/html/2607.03346#bib.bib32),1 (https://arxiv.org/html/2607.03346#bib.bib31),38 (https://arxiv.org/html/2607.03346#bib.bib41)]。为了解决这个问题,一些框架提出了基于模型的定价方法,即市场出售机器学习模型实例而不是原始数据本身[7 (https://arxiv.org/html/2607.03346#bib.bib32)]。Dealer市场框架[37 (https://arxiv.org/html/2607.03346#bib.bib44)]形式化了一个端到端系统,其中数据所有者的补偿是其Shapley值和隐私敏感度的函数。然而,这些机制通常依赖一个可信的经纪人访问所有数据集并执行估值。这引入了一个基本困境:数据所有者必须共享其数据才能被估值,但买方不再需要购买他们已经观察到的数据。通过多方计算(MPC)风格的协议对这些计算进行私有化,为可部署和可信的数据市场闭环[57 (https://arxiv.org/html/2607.03346#bib.bib27),45 (https://arxiv.org/html/2607.03346#bib.bib48)]。

**模型合并。**模型合并建立在神经网络参数通常在不同任务间表现出近似线性结构的观察之上。Ilharco等人[25 (https://arxiv.org/html/2607.03346#bib.bib25)]首先引入了任务算术,展示了从微调后的模型减去预训练模型会得到一个任务向量,其加法或减法可以编辑模型行为,从而实现多任务组合或无需重新训练的遗忘。Li等人[35 (https://arxiv.org/html/2607.03346#bib.bib50)]为任务算术提供了第一个理论证明,证明了加或减任务向量的有效性取决于底层任务的相关程度,并表明适当缩放的组合可以泛化到未见过的任务。在一项实证研究中,Ta

相似文章

贝叶斯模型合并

arXiv cs.LG

介绍贝叶斯模型合并(BMM),这是一个即插即用的双层优化框架,用于将多个任务特定的专家模型合并为一个单一模型,在视觉和语言基准测试上实现了最先进的性能。

面向可扩展多任务强化学习的大决策模型

arXiv cs.LG

本文介绍了LDM-v0,一个在来自数千个多样强化学习环境的轨迹上离线训练的大决策模型,证明了单一的Transformer策略可以在机器人、自动驾驶、库存管理、网络安全、交易和视频游戏等领域匹配特定任务策略的性能。