多范式智能体交互实践:buddyMe框架中生成器-评估器、ReAct循环与对抗性评估的系统性分析

arXiv cs.AI 论文

摘要

本文对在buddyMe框架中实现的三种智能体交互范式(生成器-评估器、ReAct循环和对抗性评估)进行了系统性分析,并提供了来自真实部署的实证案例研究。它形式化了一个五阶段流水线和一个六维评估方案,为多范式智能体系统的设计提供了实用指南。

arXiv:2605.16821v1 Announce Type: new 摘要:大语言模型(LLM)智能体的快速发展催生了多种交互范式,但很少有生产系统将多种范式整合在统一架构中。本文对三种主要智能体交互范式进行了系统性分析,包括多智能体编排(生成器-评估器)、ReAct工具使用循环和记忆增强交互,这些范式已在开源多模型智能体编程框架buddyMe中实现。我们形式化了一个五阶段处理流水线:需求预审→任务分解→ReAct执行→真实执行验证→对抗性评估讨论,并建立了一个带加权评分的六维评估方案。通过来自真实部署日志的四个实证案例研究(涵盖博物馆导览生成、定时天气预报任务和综合旅游规划),我们得出了三个关键结论。第一,生成器-评估器的预审在20%的复杂任务中检测到需求遗漏,80%的任务通过了初始检查。第二,ReAct循环保证了子任务的稳定执行,但导致了约30%的工具冗余调用。第三,对抗性评估者-防御者讨论在近70%的场景中能在2-3轮内达成共识,主要功能是内容精炼而非逻辑逆转。我们还提供了三个基于Mermaid的架构图,并在六个系统维度上与CrewAI、AutoGen、LangGraph、MemGPT和A-Mem进行了跨范式比较。研究结果为构建稳定可靠的多范式智能体系统提供了实用的设计指南。
查看原文
查看缓存全文

缓存时间: 2026/05/19 06:36

# 实践中的多范式Agent交互:buddyMe框架中生成器-评估器、ReAct循环与对抗性评估的系统分析
来源:https://arxiv.org/abs/2605.16821
查看PDF (https://arxiv.org/pdf/2605.16821)

> 摘要:大语言模型(LLM)Agent的快速发展催生了多样化的交互范式,但少有生产系统能在统一架构中集成多种范式。本文对buddyMe(一个开源多模型Agent编程框架)中实现的三种主要Agent交互范式进行了系统分析,包括多Agent编排(生成器-评估器)、ReAct工具使用循环和记忆增强交互。我们形式化了一个五阶段处理流水线:需求预审 → 任务分解 → ReAct执行 → 实际执行验证 → 对抗性评估讨论,并建立了一个带有加权评分的六维评估模式。通过基于真实部署日志的四项实证案例研究(涵盖博物馆导览生成、定时天气任务和综合旅行规划),我们得出三个关键结论。首先,生成器-评估器预审能检测出20%复杂任务中的需求遗漏,80%的任务通过初始检查。其次,ReAct循环确保了稳定的子任务执行,但导致约30%的工具调用冗余。第三,对抗性评估器-辩护者讨论在近70%的场景中能在2-3轮内达成共识,主要起内容精炼而非逻辑反转的作用。我们还提供了三张基于Mermaid的架构图,并在六个系统维度上与CrewAI、AutoGen、LangGraph、MemGPT和A-Mem进行了跨范式比较。研究成果为构建稳定可靠的多范式Agent系统提供了实用设计指南。

## 提交历史

来自:Xiaohua Wang [查看邮件 (https://arxiv.org/show-email/4a968fa8/2605.16821)] **[v1]** 2026年5月16日星期六 05:35:50 UTC (158 KB)

相似文章

使用多智能体评估对角色扮演语言智能体进行对抗性压力测试

arXiv cs.AI

本文提出了一个模块化的多智能体平台,用于对角色扮演语言智能体进行对抗性压力测试,通过策略驱动的审讯智能体和自动化评判智能体,揭示多轮对话中累积的行为失败。跨三个人设和三类LLM家族的实验表明,多策略对抗评估将鲁棒性得分降低0.17-0.20,并识别出常见的失败模式,且与人类评判高度一致。

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

创建多智能体系统

YouTube AI Channels

本视频演示了如何构建包含规划器、评估器和模拟器智能体的多智能体系统,利用Google的A2A协议和A-to-I动态UI生成来规划和模拟一场马拉松。