标签
Raven 是一个开源工具,用于协调多个AI代理执行复杂任务,并具备递归自我改进的能力。
一个在私人MMO服务器上运行400多个LLM智能体的项目,探索诸如陈旧感知、未确认操作和负载削减等挑战,使用本地部署的Qwen模型。
本文介绍了MACBT,一种具有纵向记忆的多智能体认知行为疗法决策支持系统,该系统基于中文对话训练,并与其它AI系统相比,显示出提升临床真实性和会谈质量的能力。
本文提出了一种名为SOFAI的多智能体AI架构,灵感来源于Kahneman的双系统理论,旨在通过元认知和平衡快慢推理过程来增强AI能力。
微软研究院推出了Agensh,一个自组织的多代理框架,可扩展到超过1000个代理,展示了在编码任务中无需中央协调器即可提高测试通过率的能力。
作者建议,重度AI用户可能因未优化模型选择而导致模型资源分配低效,提出应将任务路由到能胜任且成本最低的模型,以节省开支并提高效率。
本文介绍了一种名为CB-MAS的多智能体系统,用于文档敏感性分类。该系统通过迭代咨询和通道增强,解决了BERT等变压器模型中固定输入长度的局限性。
Schematize 是一个开源的多代理系统,交互式地生成和优化法律研究的信息提取模式,在人类评估中取得顶尖性能。
本文提出了MedNotes,一个多智能体管道,用于从纵向结构化EHR数据中生成有来源依据的合成临床笔记,实现了高准确性并改善了下游临床建模任务。
Agensh 是一个可扩展的自组织多代理系统,无需中央协调器,通过扩展代理数量来提高复杂任务的性能,在ProgramBench和pandoc等基准测试中显示出显著的测试通过率提升。
FinSkillOps 是一种用于SEC文件问答的多智能体系统,通过引入受控的技能管理实现自我演进,提升了金融问答系统的准确性和减少了错误。
ScientistTwo是一个完全自主的多智能体框架,进行端到端的科学研究,生成专家级的论文和代码库,这些成果超越了人类最先进模型,并达到了ICLR和NeurIPS等顶级AI会议的接受标准。
本文提出了一种用于供应链分析的混合式智能代理AI框架,该框架使用协调代理和专门代理来改进决策,实现90%的准确率,并将令牌使用量减少四倍。
本文提出 SurgicalRoomAgent,一个面向智慧手术室的语音交互多智能体系统。该系统利用大语言模型实现自然语言设备控制,重点阐述其架构设计以及为降低无菌环境延迟而采用的 KV Cache 优化、渐进式提示披露等关键技术。
本文介绍了一种多代理AI系统,用于测量和诊断LLM电子商务中的竞争可见性,采用代理搜索份额指标,并通过消融研究验证了其可行性。
本文介绍了一个用于北极生态导航的人在回路、多代理GeoAI系统,该系统整合了操作、生态和社区标准,以规划更安全、更具社会责任感的海事航线。
本文介绍了Dude,一种使用LLMs检测研究论文和代码之间不一致性的双检测多智能体系统,通过改进召回率和精确度来解决单智能体方法的局限性。
NS-Copilot是一个LLM驱动的多代理系统,能够自主支持多样化神经科学分析任务的端到端工作流程,在关键基准测试中优于基线方法。
ConvDeck 提出了一种多智能体流程,用于对话式论文转幻灯片生成,用户能在流程的不同阶段通过特定反馈迭代优化演示文稿。
EULER是一个多智能体系统,它探索跨领域迁移以自动证明或反驳数学猜想,通过压力测试验证,并在120个最新猜想上进行评估,产生证明、反驳和部分结果。