标签
本文提出了一个基准和一个多智能体系统,旨在通过多轮人类反馈改进科学图表生成,解决了质量漂移和跨修订遗忘等问题。
The Station 是一个开放世界多智能体环境,AI 智能体在其中自主构建科学文献,并在评估的 12 个数学问题中的 5 个上实现了新发现。
MARS是一个多智能体LLM框架,使用针对不同算法主题的专业智能体来解决竞赛编程问题,实现了0.624的通过率,成本更低且方差小于直接提示。
本文提出了一种多智能体框架,使LLM智能体能够使用模拟模型为药物过程设计进行受控实验,从而产生比纯语言推理更具体和可操作的建议。
项目 Munder Difflin 将多个 AI Agent 集成到虚拟办公室中,通过总管 Agent 实现任务分配、协作和自动化管理。
本文介绍了使用Grok Bot构建全天候多智能体系统的实用架构,详细描述了从单个机器人到自动化团队的步骤,该团队能以最少的人工干预处理重复性任务。
作者通过综合用户访谈和行为数据,创建了一个心理档案来配置AI写作审阅代理,使其从愤世嫉俗、技术性的受众角度批评草稿。
本文提出了一种基于CrewAI构建的多代理框架,用于自动化对话式商业智能。该框架使用五个专门的AI代理来处理查询、检索数据并生成洞察。评估显示,在准确性和质量上较基线有显著提升。
本文介绍了Sanyu Studio,一个多智能体对话系统,使用LLM为Sanyu油画构建艺术史叙事,展示了AI如何通过用户交互支持多样化的解释。
本文介绍了GxP-Agent,这是一个多代理系统,使用有向无环图(DAG)来编码监管流程,以实现使用LLM进行可靠的临床试验编程。在基准测试中,它达到了100%的准确率,而基线方法为0%。
本文探讨了在假设驱动研究中,人机协作如何推动数学问题解决和人工智能发展,并以黎曼猜想的进展以及用于架构搜索的AIRA-Compose系统为例。
SKILL是一种自纠正知识引导的迭代大语言模型代理,统一了多代理LLM推理和基于强化学习的交互,用于逻辑综合优化,实现了相比专家流程的显著改进。
本文介绍了aDSL,一种协同设计的领域特定语言和多代理系统,通过关系运算符和迭代反馈改进大语言模型驱动的3D程序合成,增强3D内容创建的鲁棒性和可控性。
TeachMateGPT提出一个多智能体框架,改进了检索增强生成技术,用于从科学教科书创建教学评估,与基线系统相比,实现了更高的忠实度和答案相关性。
本文介绍了AEROBAT,这是首个多代理系统,用于自动化AI代理的行为科学研究,包括生成假设、设计和执行受控实验以及撰写报告。作者在12个目标行为上展示了其有效性,为26个假设找到了统计证据。
This paper presents IntelliAudit, a retrieval-grounded multi-agent system that uses large language models to evaluate IT audit controls against evidence corpora, generating cited recommendations and remediation guidance. The authors instantiate it on ISO/IEC 27001 and find it useful for audit preparation while emphasizing the need for human oversight.
QFoldAgent是一个闭环多智能体框架,用于量子经典蛋白质结构预测,通过VQE和反馈迭代优化哈密顿量惩罚项,在5残基片段上实现了改进的RMSD和结构有效性。
本文提出了一种多智能体具身对话系统,该系统通过使用大语言模型(LLMs)和CEFR分类器的“生成-评估-再生成”循环,为英语学习者生成适合其水平的对话。一项针对日本大学生的初步研究显示,该系统在水平适配性方面有所提升,但未能在统计学上显著降低外语焦虑。
本文描述了提交给 eRisk 2026 挑战赛的用于对话式抑郁症筛查的混合多智能体大语言模型系统,该系统使用付费的 GPT-5-nano 或开源 Gemma 27B 模型,并辅以算法指导(对话树、可靠性加权聚合、基于聚类的插补),以较低成本实现具有竞争力的 BDI-II 评估。
Pythia是一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调,使用本地托管的开放权重模型。在临床症状检测中,其平均敏感度为0.76,特异度为0.95,在特异度上优于基于词典的方法。