标签
TeachMateGPT提出一个多智能体框架,改进了检索增强生成技术,用于从科学教科书创建教学评估,与基线系统相比,实现了更高的忠实度和答案相关性。
本文介绍了AEROBAT,这是首个多代理系统,用于自动化AI代理的行为科学研究,包括生成假设、设计和执行受控实验以及撰写报告。作者在12个目标行为上展示了其有效性,为26个假设找到了统计证据。
This paper presents IntelliAudit, a retrieval-grounded multi-agent system that uses large language models to evaluate IT audit controls against evidence corpora, generating cited recommendations and remediation guidance. The authors instantiate it on ISO/IEC 27001 and find it useful for audit preparation while emphasizing the need for human oversight.
QFoldAgent是一个闭环多智能体框架,用于量子经典蛋白质结构预测,通过VQE和反馈迭代优化哈密顿量惩罚项,在5残基片段上实现了改进的RMSD和结构有效性。
本文提出了一种多智能体具身对话系统,该系统通过使用大语言模型(LLMs)和CEFR分类器的“生成-评估-再生成”循环,为英语学习者生成适合其水平的对话。一项针对日本大学生的初步研究显示,该系统在水平适配性方面有所提升,但未能在统计学上显著降低外语焦虑。
本文描述了提交给 eRisk 2026 挑战赛的用于对话式抑郁症筛查的混合多智能体大语言模型系统,该系统使用付费的 GPT-5-nano 或开源 Gemma 27B 模型,并辅以算法指导(对话树、可靠性加权聚合、基于聚类的插补),以较低成本实现具有竞争力的 BDI-II 评估。
Pythia是一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调,使用本地托管的开放权重模型。在临床症状检测中,其平均敏感度为0.76,特异度为0.95,在特异度上优于基于词典的方法。
本文针对BioASQ 14b Task B生物医学问答挑战,提出了一种问题类型特定的大语言模型框架。该框架对是非题、事实题和列表题分别采用不同的推理策略(片段打乱、思维链、多智能体协作),取得了具有竞争力的结果,包括在第四批次的事实题子任务中获得第一名。
Prompt-to-Paper是一个多阶段多代理AI框架,用于自动化生物信息学稿件生成。它采用确定性检索增强生成、用于真实实验的自主编码代理以及八维质量评分器,以低成本生成可投稿格式的PDF,并实现了经过验证的质量提升。
Agent4cs 是一个多智能体框架,采用自底向上的方式总结大型层次化代码库,使用专门的智能体进行摘要、关键词提取和质量保证,相比于基线,在语义一致性上提升了最多 8%,在关键词覆盖率上提升了 38%。
提出DDIAgents,一种机制条件化的多智能体框架,用于药物-药物相互作用预测,该框架动态地将相关生物医学知识路由到专门的专家智能体,并聚合它们的分析,优于现有的基于特征、基于图和基于LLM的方法。
MetaResearcher 提出了一种框架,用于在对抗性虚拟环境中通过自我反思强化学习训练深度研究智能体,解决了静态环境和仅事实检索任务的局限性。
介绍了MODE-RAG,一个多智能体系统,利用变分自由能和蒙特卡洛树搜索动态门控干预,以减轻多模态检索增强生成系统中的幻觉,同时提供了ModeVent评估数据集。
作者描述了他构建的一个明斯基大脑:一个由40多个LLM代理组成的运行时,它们按照连接组(connectome)连接,并按系统发育阶段排列,以模拟大脑。他寻求关于如何在Reddit上发布这个项目的建议。
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
CAF-Gen是一个基于多智能体LLM的框架,通过迭代的创作者-评审者流水线,将浅层论证结构丰富为正式的Carneades论证框架模型,从而提高了结构对齐性和质量。
本文介绍了CatDT,一个自演化多智能体数字孪生系统,能够从块体晶体和反应描述中自主预测多相催化剂性质,在七个基准测试中达到实验精度,并发现了用于丙烷脱氢的非贵金属催化剂候选物。
一位开发者使用多智能体AI系统(Claude、Gemini、Quen)构建并部署了完整的网络安全产品ScannerSend,涵盖矿机检测、威胁情报API及支付处理,由智能体管理生产基础设施。
本文提出Traj-Evolve,一个自我进化的多智能体系统,它利用经验池和多智能体强化学习,从纵向电子健康记录中对患者轨迹进行建模,用于肺癌早期检测,性能优于强基线模型。
AutoSci是一个以记忆为中心的智能代理系统,旨在自动化完整的科学研究生命周期,从文献理解到回复审稿意见,使用基于LLM的智能体,具有持久记忆和自我进化能力。