AgentPanel:迈向人机协作探索科学问题的新范式
摘要
AgentPanel 是一个用于科学探索中人机协作的多代理论坛系统,使异构代理能够异步讨论研究问题。评估表明,它优于集中式多代理辩论,并且 65% 的参与者更倾向于使用它进行早期探索。
arXiv:2608.03283v1 公告类型:新
摘要:识别有前景的科学想法仍然是研究实践中的一个重要挑战。研究人员通常依赖小组讨论或与单个大语言模型的一对一交互,但这些方法往往只能让他们接触到有限的观点和方向。我们提出了 AgentPanel,这是一个用于科学探索中的人机协作的多代理论坛。异构代理在论坛式环境中异步讨论科学问题,而研究人员可以提交问题、浏览和组织候选想法、与代理进行后续互动,并可选地生成事后总结报告。我们从想法质量、探索广度、交互有效性、候选选择效率和实际可用性等方面对 AgentPanel 进行了评估。离线实验表明,AgentPanel 优于集中式多代理辩论基线。一项包含 20 名参与者的人机研究进一步表明,用户重视 AgentPanel 的观点多样性和探索支持。在与常用 LLM 工具的基于经验的比较中,65% 的参与者更倾向于使用 AgentPanel,认为它在研究方向的广度和早期探索的整体适用性方面均更优。该平台可在 https://agentpanel.cc/ 公开访问。
查看缓存全文
缓存时间: 2026/08/05 07:39
# AgentPanel:迈向科学问题探索中人机协作的新范式 来源:https://arxiv.org/html/2608.03283 王倩怡†\dagger∗\*闫昊洋†\dagger∗\*张逸群∗\*任思月∗\*张航帆∗\*谭泽林∗\*李浩∗\*穆春江∗\*蔡德贤∗\*张劭∗\*陈晨∗\*李萌贾建南陈雨婷叶梓超杨晓磊卢欣瑶余宇阳娄文杰王晓松凌风华冯世阳苏茂乔晟张博洋陈杨‡\ddagger白磊‡\ddagger胡舒悦‡\ddagger ###### 摘要 识别有前景的科学想法仍然是研究实践中的一个重要挑战。研究人员通常依赖小组讨论或与单个大语言模型的一对一交互,但这些方法往往只能让他们接触到有限的观点和方向。我们提出了AgentPanel,一个用于科学探索中人类与人工智能协作的多智能体论坛。异构智能体以论坛式环境异步讨论科学问题,而研究人员可以提交问题、浏览和组织候选想法、与智能体进行后续交互,并可选地生成事后总结报告。我们从想法质量、探索广度、交互有效性、候选筛选效率和实际效用等方面对AgentPanel进行评估。离线实验表明,AgentPanel优于集中式多智能体辩论基线。一项有20名参与者的人类研究进一步表明,用户重视AgentPanel所提供的观点多样性和探索支持。在与常用LLM工具的经验性比较中,65%的参与者更倾向于使用AgentPanel来获得更广泛的研究方向以及其在早期探索阶段的整体适用性。该平台公开可用,访问地址为 https://agentpanel.cc/。 参见图注图1:AgentPanel概览。研究人员向共享论坛提交科学问题,异构AI智能体在其中异步浏览、回答并相互交互。人类可以查看并参与智能体生成的想法,而AgentPanel可以生成事后报告以总结探索结果。从2026年3月到7月,AgentPanel保持公开可访问和运行状态,托管了1,508个科学问题讨论串,涉及467个智能体,并记录了超过290,000次交互事件。 ## 1 引言 发现有价值的想法仍然是科学研究中的核心挑战(quan2026towards;liu2026perspectra;lim2026understanding)。科学想法通常沿着几个相互竞争的维度进行评估,包括新颖性、科学意义、可行性和可操作性。因此,早期科学构思不是在寻找单一答案,而是一个探索、比较和优化多个候选方向的迭代过程(ref_ideabench;ref_liveideabench;qiu2025ai)。研究人员传统上依赖文献检索和与协作者讨论,但可用的专业知识、时间和观点多样性往往有限。 随着大语言模型在处理复杂任务方面的能力持续提升(wang2025perpilot;ref_camel;ref_manyheads;hu2025hands),它们越来越多地被用于支持科学构思,包括头脑风暴、文献综合和假设优化(si2025can;si2026ideation;ref_researchagent;huang2025idea2plan)。大多数现有系统遵循单一助手范式或预定义工作流,这可能限制用户接触到的观点范围(ref_researchagent;ref_ideation_review)。先前的研究表明,异构多智能体协作可以提供互补视角并提高集体表现(modelswarms;zhang2025avengers;cui-etal-2026-design;zhang2025stop)。这些发现促使我们采用一种更加开放的交互范式,让多个智能体能够独立地贡献并参与到共享的科学讨论中。 我们引入了AgentPanel,一个公开部署的多智能体人机科学论坛。从2026年3月到7月,该平台持续运行,托管了1,508个科学问题讨论串,维护了一个由467个配置智能体组成的技术池,并记录了超过290,000次交互事件。如图1 (https://arxiv.org/html/2608.03283#S0.F1)所示,研究人员可以提交科学问题、浏览候选想法、与智能体互动,并请求生成总结报告。异构的基于LLM的智能体群体独立决定查看什么、是否参与以及如何贡献。与具有固定轮次、预定义发言顺序或由裁判中介选择的集中式多智能体辩论(MAD)系统(ref_mad;ref_chateval;liang2024encouraging)不同,AgentPanel在生成时支持去中心化参与。 我们在IdeaBench(ref_ideabench)和LiveIdeaBench(ref_liveideabench)上将AgentPanel与多智能体辩论(MAD)(ref_mad)基线进行了评估,并进一步在现实科学探索场景中开展了人类研究。结果表明,AgentPanel能产生更高质量的候选想法,而参与度分析则说明了轻量级社会信号如何支持探索和筛选。人类研究的结果表明,参与者重视AgentPanel所提供的多样化和互补视角,以及其对探索空间的拓展。他们还认为AgentPanel是对其现有LLM辅助研究工作流程的有用补充,特别是在后续优化和想法深化方面。 总而言之,本文做出了三项贡献:(i)我们将早期科学构思定义为一种开放式的“人机探索”过程,其中去中心化的多智能体参与补充了传统的单助手交互;(ii)我们提出了AgentPanel,一个真实部署的多智能体科学论坛,使人类和异构的基于LLM的智能体能够通过持久化的公开讨论串进行交互;(iii)我们提供了来自基准评估、参与度信号和人类研究的经验证据,表明AgentPanel通过为人类筛选扩展多样化的候选池来支持科学构思。 ## 2 相关工作 自动化科学想法生成。大语言模型的最新进展推动了自动化科学工作流部分环节的系统发展,包括文献检索、假设生成、实验设计、实施和论文写作(ref_ai_scientist;ref_researchagent)。科学想法生成是一个关键的上游任务,因为生成的假设决定了哪些方向会进入下游验证和优化阶段。先前的研究表明,LLM可以产生被认为新颖或有前景的研究想法,同时也揭示了其在可行性、多样性、自我评估和执行后价值方面的局限性(si2025can;si2026ideation)。诸如ResearchAgent和Scideator等系统将想法生成植根于文献或重新组合现有研究要素,而IdeaBench、LiveIdeaBench和HindSight等基准则沿着原创性、相关性、可行性、清晰度和影响力等维度评估想法(ref_researchagent;ref_scideator;ref_ideabench;ref_liveideabench;ref_hindsight)。多智能体方法进一步表明,异构视角可以改善科学构思(ref_mad;ref_chateval;liang2024encouraging;ref_manyheads;ref_scienceclaw)。 用于想法生成的人机交互。科学构思也是一个交互设计问题:用户需要能够探索替代方案、比较视角,并对哪些想法值得追求保持控制。先前关于LLM辅助构思的研究表明,LLM可以帮助用户重构问题、生成替代方案、批判假设和优化早期概念(ref_ideation_review)。在研究情境下,CoQuest支持与基于LLM的智能体共同创建研究问题,Scideator将人类指导与要素重组和新颖性评估相结合,而Perspectra表明用户对专家智能体的控制可以在研究构思过程中支持批判性思维(ref_coquest;ref_scideator;liu2026perspectra)。这些系统强调了多样视角和交互式意义建构的价值,这与先前的研究发现一致,即多样性可以激发创造力,而组织不良的群体互动可能导致生产力损失或过早收敛(ref_diversity;ref_brainstorming)。 ## 3 方法 AgentPanel是一个公开可访问的多智能体论坛,用于科学探索中的人类与人工智能协作。它维持一个持久化的共享环境,人类和智能体通过不同接口操作相同的论坛对象:人类通过Web前端交互,而智能体通过结构化工具访问平台。该平台将共享基础设施与智能体层面的决策分离开来。后端维护论坛状态,而每个智能体独立决定是否参与。 参见图注图2:AgentPanel的分层架构和用户面对的工作流。Web前端和数据库维护一个持久化的科学论坛。论坛事件由调度层处理,该层管理智能体状态、上下文检索、基于规则的推荐和策略过滤。异构论坛智能体通过通用工具接口与共享状态交互,而独立的报告智能体在需要时生成可选的总结报告。 ### 3.1 分层平台架构 如图2 (https://arxiv.org/html/2608.03283#S3.F2)所示,AgentPanel采用五层架构。这种设计将论坛管理、智能体执行和模型服务分离开来,使得在保持统一论坛环境的同时,能够灵活集成不同的智能体、工具和模型。 存储与接口层。研究人员通过Web界面与AgentPanel交互,以提交科学问题、浏览讨论、查看候选想法、提供轻量级反馈(例如,点赞、点踩和星标)以及请求总结报告。一个持久化数据库存储共享的论坛状态,包括由人类和智能体生成的内容与交互,使得讨论可以跨用户会话和智能体执行持续进行。 事件与工具层。用户在论坛中的活动和智能体的活动被捕获为类型化事件,包括问题、回答和回复事件。这些事件会通知生命周期管理层有关共享论坛状态的变化。智能体通过结构化工具与论坛交互,这些工具支持诸如浏览内容、发布回答、回复现有贡献以及提供轻量级反馈等操作。 生命周期管理层。智能体生命周期管理涉及三个组件:调度、上下文管理和行动循环。调度决定智能体何时被激活,上下文管理准备所需信息,行动循环管理智能体与论坛的交互。详细信息在3.2节 (https://arxiv.org/html/2608.03283#S3.SS2)中描述。 智能体层。AgentPanel维护超过400个论坛智能体和一个专门的报告智能体。每个论坛智能体都有一个独立的配置文件,包括其行为特征、参与偏好和智能体专属的调度计划。报告智能体仅在人类用户请求时被调用,并从选定的讨论串生成结构化总结。 模型层。AgentPanel支持超过20个异构语言模型后端。不同的模型可以分配到不同的智能体配置文件,从而实现智能体行为和模型能力的灵活配置。 参见图注图3:智能体生命周期管理。平台通过Web界面、数据库和事件流维护一个持久化的共享论坛。由论坛事件或智能体专属调度触发,智能体构建执行上下文,并通过结构化工具执行观察–推理–行动循环。 ### 3.2 智能体生命周期 如图3 (https://arxiv.org/html/2608.03283#S3.F3)所示,AgentPanel通过基于触发的生命周期管理论坛智能体,其中智能体执行由论坛事件或智能体专属调度启动。 触发和激活。智能体执行可以由新生成的论坛事件或智能体专属的定时调度器触发。论坛事件包括状态变化,如新创建的问题、回答和回复。收到触发器后,生命周期管理器会根据智能体当前状态、调度计划和剩余交互配额进行激活检查。只有满足执行条件的智能体才会被实例化并进入后续阶段。 上下文组装。激活后,上下文管理模块从数据库中组装一个有界上下文,包括触发事件、智能体的行动历史、推荐讨论串和先前查询上下文。行动历史记录了当前智能体之前在论坛中做过什么,例如浏览、回答、回复或互动。为了避免对论坛进行穷举遍历,基于规则的推荐机制使用诸如新近度和参与度等信号来检索并排序一组有限的候选讨论串。产生的推荐信息用于告知而非决定智能体行为:每个智能体保留对检查哪些讨论串以及是否参与的自主权。 智能体配置文件。每个论坛智能体都有一个持久化配置文件,指定其角色形象、参与策略和回应风格。该配置文件引导智能体根据其主题兴趣和参与偏好选择讨论串。一旦选定目标讨论串,智能体特定的曝光策略将决定同行生成的内容是否被纳入观察上下文,以及纳入到什么程度。然后,智能体根据其配置的风格和互动策略作出贡献,这可能包括发布新回答、回复现有贡献或提供轻量级反馈。 行动循环。智能体遵循类似ReAct的“观察–推理–行动”循环。在观察阶段,智能体接收并组织由上下文管理器准备的上下文。然后,它调用底层LLM来解读当前状态,并确定是否值得采取有用的行动。如果是,智能体可以使用结构化工具检查或搜索讨论串、发布新答案、回复现有答案或提供轻量级反馈;否则,它可以选择弃权。成功的行动会更新数据库,并可能发出新事件以激活其他符合条件的智能体。当智能体完成任务、自愿弃权或达到配置的行动限制时,循环终止。 ### 3.3 成本感知执行 出于实际部署需求,AgentPanel在智能体生命周期中引入了成本感知的参与策略。这些策略调节智能体观察的信息量、生成内容的数量以及论坛交互的频率。这些机制实现了成本感知的智能体参与,同时保留了不同智能体之间的多样化探索行为。 曝光策略控制纳入智能体观察中的同行生成内容的数量。在低曝光策略下,智能体主要依赖原始问题进行探索;在中度曝光策略下,智能体检查有限数量的先前答案;在高曝光策略下,智能体回顾更大部分的讨论。这种异构曝光防止所有智能体都接收到完整的讨论串上下文。回应风格规范智能体生成内容的长度和格式。一些智能体生成简洁、注结论的回应,而另一些则生成更详细的解释或结构化
相似文章
利用开放环境中AI代理的集体智慧实现新发现
本文介绍了EinsteinArena,一个代理原生平台,通过自主AI代理之间的开放交互,实现去中心化的科学发现。该平台已经产生了12项新的最先进成果,包括改进了11维接吻数问题的最佳已知下界,从593提高到604,这表明集体AI驱动的研究可以源自代理之间分享见解并相互借鉴。
多智能体系统
一位社区成员分享了一个多智能体AI系统(AIPass)的GitHub仓库,希望获得关于其功能和潜在应用的反馈。
@TheTuringPost: AutoScientists – 一个由智能体组成的研究实验室 @哈佛大学的研究人员将智能体连接成一个自组织的科学…
哈佛大学研究人员提出 AutoScientists,一个没有中央协调器、能够形成自组织科学团队的多智能体系统,在 BioML-Bench 和优化任务上取得了强劲成果。
使用不同AI代理协作同一项目
探讨了使用多个AI代理协作同一项目的概念,讨论了多代理工作流的挑战与方法。
当AI智能体拥有自己的协作网络时会发生什么?
探讨AI智能体在网络中协作的未来,引用AnvitaFlow和Moltbook等项目,并提出关于信任和智能体服务市场的问题。