当帮助变成伤害及其修复方法:用于数据清洗的多智能体辩论

arXiv cs.AI 论文

摘要

本文研究了多智能体辩论在数据清洗中何时有帮助何时有害。研究发现,辩论会由于批评引发的混淆而降低生成质量,但能提升错误检测能力。本文提出了一个辩论收益条件,并表明,通过对抗性分离与代码执行基础,首次实现了在生成任务上显著超过单智能体性能的配置。

arXiv:2606.02866v1 公告类型:新 摘要:多智能体辩论何时有助于数据清洗,何时又有害?在三个基准测试、四个模型家族和超过6000个任务-条件对上,我们发现辩论的效果会反转:在所有四个模型上,它通过批评引发的混淆(CIC)——即Critic提供幻觉反馈而Generator不加批判地接受——使生成质量下降(-1.6至-15.5个百分点),但提高了错误检测能力(F1提升27.4个百分点,d=1.0)。我们推导出一个辩论收益条件:当挽救错误输出的概率(Critic验证几率乘以可修复性)超过破坏正确输出的概率时,辩论有益。一项因子实验证明,对抗性分离至关重要:使用相同工具的自我验证失败,而一个独立的Critic结合代码执行基础和证据门控生成,首次实现了在生成任务上显著超过单智能体性能的辩论配置(+5.3个百分点,p<0.05)。该条件正确预测了全部九种任务类型,并在七个领域的19个已发表比较中实现了零假阳性泛化。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:41

# 当帮助变成伤害以及如何修复:面向数据清洗的多智能体辩论  
**来源:** https://arxiv.org/html/2606.02866  

\[1\] Meta Platforms, Inc.  
\*通讯作者  
通讯作者邮箱:Chirag Parmar([email protected])  
(2026年6月)  

###### 摘要  

多智能体辩论何时有助于数据清洗,何时会适得其反?在三个基准测试、四个模型系列以及超过 6000 个任务-条件组合上,我们发现辩论的效果发生了反转:在所有四个模型上,辩论都导致了生成质量的下降(−1.6\-1.6 至 −15.5\-15.5 个百分点),原因是*批评诱发混淆*(Critique-Induced Confusion, CIC)——评论者(Critic)产生的幻觉反馈被生成者(Generator)不加批判地接受;然而,辩论却提升了错误检测能力(F1 值提升 +27.4\+27.4 个百分点,d=1.0d{=}1.0)。我们推导出一个*辩论收益条件*:当辩论能够解救错误输出的概率(评论者验证几率乘以可修复性)超过破坏正确输出的概率时,辩论才有帮助。一项析因实验证明,对抗性分离至关重要:使用相同工具进行自我验证会失败,而采用独立的评论者(具备代码执行依据和证据门控生成机制)则首次在生成式任务上显著超越单智能体(+5.3\+5.3 个百分点,p<0.05p{<}0.05)。该条件正确预测了全部九种任务类型,并在七个领域的 19 个已发表比较中实现了零误报推广。  

## 1 引言  

数据清洗历来消耗数据工程师 60%–80% 的时间(Dasu and Johnson, 2003 (https://arxiv.org/html/2606.02866#bib.bib9); Ilyas and Chu, 2019 (https://arxiv.org/html/2606.02866#bib.bib19); Whang et al., 2023 (https://arxiv.org/html/2606.02866#bib.bib48)),如今大语言模型(LLM)已被常规部署用于自动化这一负担(Narayan et al., 2022 (https://arxiv.org/html/2606.02866#bib.bib34))。近期工作表明,LLM 能够生成数据清洗工作流(Li et al., 2024a (https://arxiv.org/html/2606.02866#bib.bib27))、检测表格数据中的异常(Li et al., 2024b (https://arxiv.org/html/2606.02866#bib.bib28); Zhang et al., 2024a (https://arxiv.org/html/2606.02866#bib.bib54)),以及编排多步骤流水线(Qi and Wang, 2024 (https://arxiv.org/html/2606.02866#bib.bib38))。然而,LLM 的幻觉问题仍然是关键障碍:当 LLM 建议清理一个不存在的列,或删除实际上不重复的记录时,流水线会静默地破坏数据。多智能体辩论——即在部署前,一个对抗性的评论者(Critic)挑战生成者(Generator)的提议——提供了一种缓解手段(Du et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib11); Liang et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib30); Irving et al., 2018 (https://arxiv.org/html/2606.02866#bib.bib20); Leike et al., 2018 (https://arxiv.org/html/2606.02866#bib.bib24); Bowman et al., 2022 (https://arxiv.org/html/2606.02866#bib.bib3))。架构上的改进,如回复匿名化(Sharma et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib40); Wei et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib47); Choi et al., 2025 (https://arxiv.org/html/2606.02866#bib.bib6))和任务隔离,旨在减少谄媚行为(sycophancy)并实现独立验证。然而,现有评估仅集中在受限的推理任务上(算术、事实问答、常识推理(Chan et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib4); Khan et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib21); Chen et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib5); Wang et al., 2024a (https://arxiv.org/html/2606.02866#bib.bib43))),这些任务答案空间小且验证简单。  

数据清洗则是根本不同的:它需要特定表模式的依据,并生成可执行的操作,而非闭式答案。同时,先前的数据清洗系统依赖于概率推理或统计模型(Rekatsinas et al., 2017 (https://arxiv.org/html/2606.02866#bib.bib39); Mahdavi et al., 2019 (https://arxiv.org/html/2606.02866#bib.bib32); Heidari et al., 2019 (https://arxiv.org/html/2606.02866#bib.bib15)),而新兴的基于 LLM 的方法(Li et al., 2024a (https://arxiv.org/html/2606.02866#bib.bib27); Qi and Wang, 2024 (https://arxiv.org/html/2606.02866#bib.bib38))则完全采用单智能体架构。尚无研究评估过辩论在数据清洗的全部子任务上是有益还是有害。先前的辩论工作表明,辩论在受限推理上有所改进,但当智能体具有说服力但错误时则会造成损害(Khan et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib21))。Zhang 等人(2025 (https://arxiv.org/html/2606.02866#bib.bib53))的并发工作在九个推理基准上大规模展示了这一现象;我们则从机制(*为什么*辩论会失败)、形式化条件(*何时*有帮助)和修复方法(*如何*恢复)三个角度补充了他们的发现。我们的生成者-评论者拓扑结构遵循 Du 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib11))的表述(两个 LLM 智能体,无人类裁判),在架构上与 Irving 等人(2018 (https://arxiv.org/html/2606.02866#bib.bib20))提出的辩论即对齐(debate-as-alignment)方案不同。数据管理文献长期以来区分了错误*检测*与错误*修复*(Wang and Strong, 1996 (https://arxiv.org/html/2606.02866#bib.bib44); Fan and Geerts, 2012 (https://arxiv.org/html/2606.02866#bib.bib13));我们的辩论收益条件将这一经典区分与多智能体系统联系起来。  

“辩论何时有帮助”这一疑问具有实际紧迫性。多智能体架构正越来越多地部署于生产数据流水线,但缺乏预测其效果的原理性框架,实践者只能进行昂贵的试错。在生成式任务上部署辩论会导致批评诱发混淆(CIC),浪费 4–7 倍的计算预算并降低输出质量。反之,在检测任务上不部署辩论(本可获得 27 个百分点的 F1 提升)则会白白损失巨大的质量收益。我们的辩论收益条件提供了一个可部署的决策规则:三个可估计的量决定了是投资辩论还是坚持单智能体。完整相关工作见第 2 节(https://arxiv.org/html/2606.02866#S2)。  

一项受控实验直接回答了这个问题。我们的贡献是:  

1. **一个预测辩论何时有益的辩论收益条件。** 我们推导出一个形式化条件:当评论者的验证几率(经可修复性加权)超过生成者的基线准确率几率时,辩论能提升输出质量。该条件正确预测了我们研究中全部九种任务类型,并在七个领域的 19 个已发表比较中实现了零误报推广。  
2. **批评诱发混淆是结构性的,而非提示依赖。** 对 6 种评论者变体 × 3 种生成者变体的扫描证实,CIC 在所有提示配置下均存在,且不是采样伪影(自一致性多数投票的表现比单智能体更差)。一项析因实验证明,对抗性分离至关重要:使用相同工具进行自我验证会失败,而独立的对抗性评论者则能成功。第 7 节(https://arxiv.org/html/2606.02866#S7)表明,CIC 可以通过有依据的验证来解决。  
3. **基于代码执行的依据与证据门控生成相结合,超越了单智能体。** 将评论者置于代码执行沙箱中,消除了 CIC。再加上证据门控生成(生成者仅采纳引用特定数据证据的反馈),首次在生成工作流任务上产生了显著优于单智能体的辩论配置(+5.3\+5.3 个百分点,p<0.05p{<}0.05)。  

## 2 相关工作  

#### 用于数据清洗的 LLM。  
AutoDCWorkflow(Li et al., 2024a (https://arxiv.org/html/2606.02866#bib.bib27))引入了一个由 LLM 编排的流水线,该流水线能从清洗目的的自然语言描述中生成数据清洗工作流。CleanAgent(Qi and Wang, 2024 (https://arxiv.org/html/2606.02866#bib.bib38))将其扩展为一个代码生成智能体,能够迭代地完善清洗脚本。Fang 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib14))对 LLM 在数据清洗中的应用进行了调研,发现尽管 LLM 在异常检测和标准化方面显示出潜力,但幻觉导致的错误仍然是生产部署的主要障碍。Li 等人(2024b (https://arxiv.org/html/2606.02866#bib.bib28))证明,当列语义模糊时,LLM 在表格数据理解上存在困难。先前的数据清洗系统使用完整性约束上的概率推理(HoloClean(Rekatsinas et al., 2017 (https://arxiv.org/html/2606.02866#bib.bib39))、集成错误检测策略(Raha(Mahdavi et al., 2019 (https://arxiv.org/html/2606.02866#bib.bib32))、少样本学习(HoloDetect(Heidari et al., 2019 (https://arxiv.org/html/2606.02866#bib.bib15)))或声明式规则(Dallachiesa et al., 2013 (https://arxiv.org/html/2606.02866#bib.bib8); Chu et al., 2015 (https://arxiv.org/html/2606.02866#bib.bib7); Krishnan et al., 2016 (https://arxiv.org/html/2606.02866#bib.bib23));基于 LLM 的方法承诺更大的灵活性,但也引入了新的失效模式。特别地,在实体匹配方面,深度学习方法(Mudgal et al., 2018 (https://arxiv.org/html/2606.02866#bib.bib33); Li et al., 2020 (https://arxiv.org/html/2606.02866#bib.bib29); Peeters and Bizer, 2024 (https://arxiv.org/html/2606.02866#bib.bib37))和模式匹配系统(Do and Rahm, 2002 (https://arxiv.org/html/2606.02866#bib.bib10); Koutras et al., 2021 (https://arxiv.org/html/2606.02866#bib.bib22))提供了强基线,LLM 辩论必须超越这些基线。  

#### 多智能体辩论。  
Du 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib11))提出了多智能体辩论,其中 LLM 智能体通过结构化论证迭代地完善答案,并在算术和事实推理上展示了改进。Liang 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib30))引入了“思考者-裁判”(thinker-judge)拓扑结构,并证明了*发散性*思维能改进创意和分析性任务。Chan 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib4))将多智能体评估应用于开放式文本生成。Khan 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib21))发现,当智能体具有说服力但错误时,辩论可能是有害的,这预示了我们的结果。Chen 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib5))展示了圆桌讨论通过共识改进了推理,而 Wang 等人(2024a (https://arxiv.org/html/2606.02866#bib.bib43))则探讨了多智能体讨论何时优于单智能体推理。Zhang 等人(2024b (https://arxiv.org/html/2606.02866#bib.bib55))通过社会心理学视角探索了协作机制。近期工作研究了用于复杂任务求解的多智能体框架(Wu et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib50); Hong et al., 2024 (https://arxiv.org/html/2606.02866#bib.bib17); Li et al., 2023 (https://arxiv.org/html/2606.02866#bib.bib25); Wang et al., 2024b (https://arxiv.org/html/2606.02866#bib.bib46))。Talebirad and Nadiri(2023 (https://arxiv.org/html/2606.02866#bib.bib42))提供了多智能体协作模式的分类法。Parrish 等人(2022 (https://arxiv.org/html/2606.02866#bib.bib36))发现,单轮辩论并不能帮助人类回答困难的阅读理解问题,这是一个与我们在生成式任务上的发现相平行的负面结果。Huang 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib18))表明,LLM 无法在没有外部反馈的情况下自我纠正推理,这为 CIC 机制提供了补充视角。Zhang 等人(2025 (https://arxiv.org/html/2606.02866#bib.bib53))的并发工作认为,决定辩论有效性的是任务结构,而非模型能力或提示设计,这证实了我们对提示敏感性的发现。  

#### LLM 谄媚行为与匿名化。  
Sharma 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib40))记录了多个 LLM 家族中的谄媚行为,即模型即使面对错误也会服从于陈述的用户偏好,这种倾向被 RLHF 训练(Ouyang et al., 2022 (https://arxiv.org/html/2606.02866#bib.bib35); Bai et al., 2022 (https://arxiv.org/html/2606.02866#bib.bib2))所放大。在多智能体系统中,谄媚行为表现为一个智能体顺从另一个智能体的权威。Wei 等人(2024 (https://arxiv.org/html/2606.02866#bib.bib47))表明,合成数据可以减少谄媚行为,而 Choi 等人(2025 (https://arxiv.org/html/2606.02866#bib.bib6))则证明,匿名化专门缓解了多智能体辩论中基于身份的偏见。  

#### 可扩展监督与辩论理论。  
Irving 等人(2018 (https://arxiv.org/html/2606.02866#bib.bib20))提出了辩论作为一种可扩展 AI 对齐机制,利用了如下理论结果:具有多项式时间验证者的交互式证明可以验证来自指数强大证明者的声明。Leike 等人(2018 (https://arxiv.org/html/2606.02866#bib.bib24))将其扩展到递归奖励建模,其中人类监督应用于最细粒度的可行层面,然后再进行组合。Bowman 等人(Bowman et al., 2022 (https://arxiv.org/html/2606.02866#bib.bib3))通过衡量辩论是否帮助非专家人类回答专家级问题,将辩论操作化为可扩展监督。我们的工作提供了一个经验桥梁:辩论收益条件精确地指出了“验证者效率”假设何时成立(高 pcpp\_c)以及何时失效(低 pcpp\_c),从而将理论框架与实际部署决策联系起来。  

## 3 实验设置  

#### 问题设定。  
给定一个脏表TdirtyT\_{text{dirty}},包含nn行 mm 列(混合类型:字符串、数值、日期)以及清洗目的pp,生成一个工作流W=[w1,...,wk]W=[w_{1},...,w_{k}]。我们评估结构幻觉(事实一致性,FC)和语义正确性(通过确定性执行实现的单元格级准确性)。  

#### 基准测试。  
我们使用三个覆盖互补评估范式的基准测试:  

*   **AutoDCWorkflow**(Li et al., 2024a (https://arxiv.org/html/2606.02866#bib.bib27)):提供跨越 6 个领域(食品检查、餐厅菜单、医院记录、大学数据、住房数据和员工记录)的 142 个数据清洗任务;每个任务包含一个脏表、真实干净表和清洗目的,模型必须生成一个多步骤清洗工作流(通过 FC 和单元格级准确性评估)。任务范围从简单的标准化(“标准化电话号码”)到复杂的多步骤转换(“拆分合并的姓名字段、去重记录、标准化日期格式”)。表格中位大小为 15 行 8 列。  
*   **MMTU**(Xing et al., 2025 (https://arxiv.org/html/2606.02866#bib.bib51)):包含 28,136 个表理解问题,涵盖 16 种任务类型。我们从四种与清洗相关的类型中随机抽取 200 个问题(每类 50 个,按数据集分层,随机种子=42):错误检测(识别存在数据质量问题的新单元格)、数据填补(预测缺失值)、实体匹配(判断两条记录是否指代同一实体)和模式匹配(对齐不同表模式的列)。MMTU 评估*理解*能力——模型是否能推理表的结构和内容,这与 AutoDCWorkflow 对*生成*的评估以及 MaTElDa 对*检测*的评估形成互补。  
*   **MaTElDa**(Ahmadi et al., 2025 (https://arxiv.org/html/2606.02866#bib.bib1)):提供 1,173 个真实世界表…(原文在此中断)

相似文章

潜在智能体:一种内化多智能体辩论的后训练方法

Hacker News Top

波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。

停止构建多智能体系统

Reddit r/AI_Agents

一篇观点文章认为,向系统中添加更多智能体通常是解决可靠性问题的错误方法,而一个精心设计的、具有更好上下文、工具、护栏和评估的单一智能体通常更优。

如何提高AI代理的可靠性?

Reddit r/AI_Agents

讨论将AI代理从沙箱迁移到生产环境所面临的挑战,强调高敏感性导致大量噪声,并提出解决方案,如二级评估器、启发式方法和级联架构。同时向社区询问他们的过滤方法。