标签
Paper2Agent 是一个发表在 Nature 上的多智能体框架,它自动将研究论文转化为虚拟作者,使 AI 智能体能够与科学知识进行交互并在此基础上构建,从而促进更深入的发现。
RSIAgent 是一个无需训练的多智能体框架,它使数字智能体能够通过递归自我改进、自主记忆构建和广度优先然后深度优先的探索来适应新环境,在基准测试中优于闭源模型。
本文提出了一个基准测试(DNBench),用于评估LLM在数据库规范化任务中的表现,并引入了一个多智能体推理框架(MARS),该框架相比单提示方法将准确率提高了82%。
本文介绍了PACE,一个用于评估AI模型是否能通过检索隐式知识库事实来识别用户请求中隐藏冲突的数据集,并提出了PaceMaker,一个增强冲突感知决策的多智能体框架。
这篇文章描述了GenOS,一个自定义多智能体框架,它自主演化Rust算法来解决NP难的逆生命游戏问题,发现了三种优化范式,并证明了378/400的数学极限。
HERMES是一个可扩展的多代理框架,用于从地球科学中超长科学文档中提取结构化知识,实现了高准确度和相对于人工方法六倍的效率提升。
本文研究了LLM生成的硬件描述语言问答中的质量问题,发现过度回答倾向,如冗余(65.7%)和冗长(69.1%),并提出了一种多智能体框架,将核心答案减少37%,非核心内容长度减少31%,同时提高质量分数。
介绍了一个针对LLM游戏智能体的自动提示优化框架,该框架将观察-行动流水线分解为两个智能体,并通过环境回报引导的进化循环迭代优化提示。在BabyAI任务上评估,显著提高了成功率(例如,在PutNext上从0%提升到72.5%),且无需更新模型权重。
PRISM 是一个多智能体框架,通过将语音感知、响应生成和语音合成解耦,并结合韵律线索与大语言模型推理及外部知识工具,以提升共情口语对话的质量。
Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。
本文提出AuditFlow,一种基于图的多智能体框架,利用可执行符号环境进行结构化财务报告验证,在基于FinAuditing的样本上使用GPT-5.5实现了82.09%的审计准确率。