标签
一项针对GPT-4o-mini的仿真研究发现,将分诊决策分布到带有审计阶段的多智能体流水线中并不会减少偏见结果,但审计能力显著影响偏见是否被发现。按估计风险对审计进行重新排序,可以在负载下恢复大部分丢失的覆盖范围。
本文提出隔离双边强化学习(IB-RL),该方法让两个对话角色通过联合采样轨迹共同演化,同时各自独立优化自身奖励。该方法解决了策略性对话中强化学习的静态对手不匹配问题,并在 Vehicle TeleSales 和 Deal-or-No-Deal 基准上展现了对未见对手更强的泛化能力。
本文介绍了CGMas,一个多智能体LLM框架,可自动化聚合物的粗粒化分子动力学,包括拓扑构建、平衡、映射、势推导和验证。它完成了27项聚合物任务,并在大多数情况下将原子级密度匹配在5%以内,大幅缩短了模拟时间。
ProtoLink 是一个轻量级的 A2A 优先 Python 框架,用于构建可插拔的代理和多代理系统,强调本地优先、与 LLM 无关的设计,并支持可选模块。
本文介绍了一个开源的A2A实验,五名AI智能体组成的陪审团审议一起机器人出租车事故,表明直接的智能体间通信可以翻转集体判决,同时通过事件账本让影响路径可检查。
LangChain 开源了 open_deep_research,基于 LangGraph 的多智能体架构,完全开源复刻 OpenAI Deep Research,支持多种模型和搜索工具,可本地部署生成深度研报。
在 AI Engineer 演讲中,Cognition 联合创始人 Walden Yan 不建议使用多智能体系统,称它们很脆弱,而 Devin 背后的团队现在使用的是具有连贯上下文的单一智能体。
描述了“Gauntlet Loop”,一个病毒式传播的三行Claude提示词,它使用带批评者的子代理,迭代改进输出,直到达到你设定的质量标准。
一位工程师讨论了基于邮箱的智能体消息传递的局限性,并提出在代码图之上进行结构化寻址,以计算消息路由的爆炸半径,认为这是扩展到三个以上智能体的关键。
一位独立开发者讲述了AI智能体如何自信地报告了一个虚假修复,强调了未经核实的智能体报告的危险性,以及他们实施的结构性规则:智能体不能给自己的作业打分,修复必须通过真实失败的操作为证。
Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。
介绍 Claude Code 生态中的 /swarm 多 Agent 并行扇出模式近期被默认禁用并增加硬性限制,原因在于失控递归和成本爆炸。
Prime RL 现在支持表示和训练多智能体系统,可实现智能体裁判、自我对弈、用户模拟以及复杂智能体协作等用例。
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
INTraJ 是一个统一的轨迹预测框架,将社会影响分解为两个阶段:利用未来社会信息进行规划,以及从残差中产生局部反应,在 Argoverse 2、ETH/UCY 和 SDD 基准上取得了最先进的结果。
Introduces CANOE, a multi-agent neuro-symbolic framework for open-ended care plan coordination that uses argumentative computation and human-in-the-loop contestation to improve transparency, safety, and clinical correctness.
OrchestraBench 是一个新的基准测试,用于评估多智能体编排框架在故障模式、恢复和分解质量方面的表现,通过故障注入和级联半径指标来诊断流水线在何处以及为何失败。
本文提出了抽象事件因果规则(AECR),一种关系级因果抽象范式,将具体的因果关系对转化为广义的因果逻辑。它引入了一个用于因果归纳的多智能体系统和一个基于注意力的编码器,从而改善事件预测,尤其是对稀有和未见事件。
本文提出了Agentic Nesting,一种多智能体协作框架,将现有企业应用封装为分层嵌套结构中的AI智能体,实现自然语言交互和跨应用编排,作为传统ESB/API/RPA集成方法的替代方案。