Multi-Persona Debate System:用于自动化科学假设生成

arXiv cs.CL 论文

摘要

本文介绍了Multi-Persona Debate System(MPDS),这是一个基于文献的框架,利用大语言模型、角色归纳和结构化多智能体辩论来自动生成科学假设。在电池材料研究中的评估表明,该框架提高了假设质量并实现了跨视角整合。

arXiv:2605.23917v1 Announce Type: new 摘要:现代科学发现的瓶颈并非数据匮乏,而是无法将碎片化知识整合为可操作的假设。这一挑战在电池材料研究中尤为严峻,因为电化学性能、界面行为和制造可行性必须同时优化。在此,我们提出了Multi-Persona Debate System(MPDS),这是一个基于文献的自动化科学假设生成框架,结合了文献检索、长上下文大语言模型推理、语料驱动的角色归纳和结构化多智能体辩论。MPDS构建多达500篇论文的文献快照,将智能体锚定在特定角色的证据池中,并进行三轮引用感知辩论,随后由主持人综合,从而在保持证据可追溯性的同时实现角色间的协商。我们采用一个时间控制的协议对MPDS进行评估,该协议排除了对目标论文的直接访问,包括两个留出的电池材料案例研究和跨30个匹配案例的盲法比较。在钠离子负极和全固态电池正极设计任务中,MPDS恢复的设计逻辑与实验验证的解空间一致,并生成了比简单基线更具机制明确性和过程感知性的提案。为了评估角色和辩论的影响,我们引入了Integrative Hypothesis Quality评分。在消融研究中,MPDS在五个条件中获得了最高平均分,其在跨视角整合方面的优势最大。一项实验室后续研究提示其作为诊断工具识别工作流程实际瓶颈的效用。这些结果表明,基于文献快照的结构化辩论改善了耦合工程约束下的假设形成,并为文本密集型科学发现提供了可重复使用的工作流程。
查看原文
查看缓存全文

缓存时间: 2026/05/26 08:58

# 多角色辩论系统实现自动化科学假说生成
来源:https://arxiv.org/abs/2605.23917
查看PDF (https://arxiv.org/pdf/2605.23917)

> **摘要**:现代科学发现的瓶颈并非数据匮乏,而是无法将碎片化知识整合为可操作的假说。这一问题在电池材料研究中尤为突出——电化学性能、界面行为及制造可行性必须同步优化。为此,我们提出多角色辩论系统(Multi-Persona Debate System, MPDS),这是一个基于文献的自动化科学假说生成框架,融合了文献检索、长上下文大语言模型推理、语料驱动角色归纳以及结构化多智能体辩论。MPDS构建了涵盖多达500篇论文的文献快照,将智能体锚定于角色特定的证据池中,并开展三轮引用感知辩论,随后由协调者进行综合,从而在保持证据可溯源性的同时实现角色间的协商。我们采用时间控制协议(排除对目标论文的直接访问)评估MPDS,其中包括两个独立的电池材料案例研究以及一项覆盖30个匹配案例的盲法对比。在钠离子负极与全固态电池正极设计任务中,MPDS成功还原了与实验验证解空间相符的设计逻辑,并生成了比简单基线更为机制明确且考虑工艺过程的方案。为评估角色与辩论的影响,我们引入了综合假说质量评分。在消融研究中,MPDS在五种条件下取得了最高平均分,其最大优势体现在跨视角整合能力上。实验室后续实验表明,该框架可作为诊断工具,帮助识别工作流程中的实际瓶颈。这些结果表明,针对文献快照的结构化辩论能在复杂工程约束下改善假说形成,并为文本密集型的科学发现提供了可复用的工作流。

## 提交历史

来自:李巨 \[查看邮箱 (https://arxiv.org/show-email/435380cf/2605.23917)\] **\[v1\]** 2026年4月14日星期二 16:57:12 UTC (1,605 KB)

相似文章

L-MAD:法律推理中多智能体辩论结构的系统性评估

arXiv cs.AI

本文介绍了L-MAD,一个用于系统性评估法律文本蕴含中多智能体辩论结构的框架。研究发现,增加智能体数量可提升准确率,但延长辩论轮次会导致有害的过度 deliberation 漂移,使得智能体互相强化错误,相较于单智能体基线最高提升8%。

潜在智能体:一种内化多智能体辩论的后训练方法

Hacker News Top

波士顿大学的研究人员提出了 IMAD(内化多智能体辩论),这是一个两阶段微调框架,能够将多智能体辩论过程提炼至单个 LLM 中,在匹配甚至超越显式多智能体辩论性能的同时,实现最高 93% 的 token 用量缩减。该研究还揭示了激活空间中存在特定于智能体的子空间,从而可以对内化推理行为进行有效控制,包括抑制恶意智能体的影响。

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。