使用Incognita在社交分布式任务环境中评估具有行动基础的生成式代理
摘要
本文介绍了Incognita,一个用于在知识按角色划分的社交分布式任务环境中评估生成式代理的框架。实验显示代理的成功率有所提高,但整体可靠性仍然较低。
arXiv:2607.02975v1 Announce Type: new
Abstract: 在社交环境中,有效的代理取决于代理何时寻求知识、何时行动以及其行动是否基于所获得的信息。现有的基于grounded的基准提供了可执行的操作、持久的状态和可验证的结果,而社交模拟环境则提供了语言代理之间的丰富交互。我们研究了一种结合这些要求的评估设置。我们将社交分布式任务环境定义为交互式环境,其中与任务相关的知识在按角色隔离的参与者之间分配,并且只能通过这些参与者进行有后果的行动。沟通作为对按角色划分的知识的探索,而grounded行动则作为对环境状态的利用。我们介绍了Incognita,一个基于Concordia的框架,将社交互动与grounded执行分开。评估的代理将消息路由到用户或专业实体;专业实体调解允许的操作;一个确定性的子环境在规范状态上执行接受的操作;一个离线评估器使用继承的奖励对结果进行评分。Incognita-Retail将tau-bench零售转变为多实体环境,同时保留最终状态奖励语义。我们在18个按社交广度分层的任务上评估了三个生成式代理模型,共540次试验。在奖励和行为方面出现了进展:成功率从0%上升到8.9%和17.2%,而提前结束从100%下降到87%和58%。更强的模型引出更多隐藏知识,接触更多实体,并尝试更多grounded写操作,但可靠性仍然较低。这些发现表明,社交分布式任务环境在可靠成功之前会暴露行为,包括知识获取、来源选择、grounded行动尝试和过早完成信念。
查看缓存全文
缓存时间: 2026/07/07 04:34
# 使用Incognita评估生成式智能体在社交分布式任务环境中的行动 来源: https://arxiv.org/abs/2607.02975 查看PDF (https://arxiv.org/pdf/2607.02975) > 摘要:社交环境中的有效能动性取决于智能体何时寻求知识、何时行动,以及其行动是否基于所获信息而合理。现有的具身基准测试提供可执行的行动、持久状态和可验证的结果,而社交模拟环境则提供语言智能体之间的丰富交互。我们研究了一种结合这些要求的评估设置。我们将社交分布式任务环境定义为一种交互式环境,其中任务相关知识在角色隔离的参与者之间分布,而后果性行动仅能通过这些参与者执行。沟通是对角色分区知识的探索,而具身行动则是对环境状态的利用。我们引入了Incognita,一个基于Concordia的框架,将社交互动与具身执行分离开。被评估的智能体将消息路由给用户或专业实体;专业实体中介可允许的操作;一个确定性子环境在规范状态上执行已接受的操作;一个离线评估器使用继承的奖励对结果进行评分。Incognita-Retail将tau-bench零售任务转换为多实体环境,同时保留最终状态奖励语义。我们在18个按社交广度分层的任务上评估了三种生成式智能体模型,共进行了540次试验。奖励和行为方面均取得了进展:成功率从0%上升到8.9%和17.2%,而过早结束率从100%下降到87%和58%。更强的模型能引出更多隐藏知识、联系更多实体、并尝试更多具身写入,但可靠性仍然较低。这些发现表明,社交分布式任务环境能在可靠成功之前暴露行为,包括知识引出、源选择、具身行动尝试以及过早完成信念。 ## 提交历史 来自:Dan C. Hsu [查看电子邮件 (https://arxiv.org/show-email/c69b7643/2607.02975)] **[v1]** 周五,2026年7月3日 05:34:21 UTC (421 KB)
相似文章
在线Agent-as-a-Judge:交互式智能体的情境生成评估
提出在线Agent-as-a-Judge评估框架,该框架利用世界内评估智能体主动生成情境来测试交互式社交智能体,在覆盖率和可靠性上优于被动方法。
有基准却无度量——生成式人工智能应以现实效用为评估标准
本文主张生成式人工智能的评估应从静态基准转向衡量现实效用和人类成果。文章提出了 SCU-GenEval 框架及辅助工具,旨在解决基准表现与部署成功之间的脱节问题。
智能体模型批判
本文批判了当前的AI智能体系统,区分了外在脚手架(agentic)和内在化(agentive)系统,并提出了目标-身份-配置器(GIC)架构,用于构建具有内生能力的通用智能体模型,同时提供了关于安全性和可控性的见解。
分布式通用智能体网络:架构、关键机制与原型
本文提出了一种分布式通用智能体网络的分层架构,使异构AI智能体能够在个人设备和边缘节点上发现、信任并协同完成开放式任务。
衡量智能体之间的对抗与协作
作者搭建了一个名为 Glomz 的平台,在该平台中,具有不同能力的 AI 智能体在竞技场环境中互相审查代码。实验揭示了诸如评审级联和跨模型洞察等涌现行为,但也暴露了编排和参与率方面的挑战。