@AdamRLucek: 智能体是听从你…还是听从自己?在评估深度智能体系统中的子智能体行为时,我们注意到一个有趣的现象…
摘要
一位研究人员分享了在深度智能体系统中评估子智能体行为时的观察,注意到智能体在遵循手写系统提示与编排器指令之间出现了一个有趣的偏差。
查看缓存全文
缓存时间: 2026/05/21 19:37
代理(Agent)是听你的,还是我行我素?在评估深度代理系统中的子代理行为时,我们注意到一个有趣的现象:代理对于手动编写的系统提示与编排器给予的指令在遵循程度上存在差异。1/4
在一个“大海捞针”式的分类评估任务中,主代理依赖多个子代理解析大量大型(百万级token)数据点并将它们聚类成相关组。我们发现,根据编排器发送给子代理的额外指令的长度和具体程度,子代理的性能和行为会发生不同变化。2/4
虽然我们的子代理系统提示通常是方向性且开放式的,但有些模型提供了详细的评分标准和指南,导致子代理行为过度严格,限制了其创造性执行,从而损害了最终性能。代理的这些更长的指令往往在方向上覆盖了我们希望通过提示鼓励的宽松行为。3/4
启示?重要的是不仅要考虑如何提示子代理,还要考虑主代理如何提示它。代理与其子代理委派之间的关系可以成就或破坏整个系统的成功。4/4
说得对!方向性优于精确性
也许我们已经实现AGI了…
有什么建议吗?
相似文章
昨天发帖讨论了智能体调试的恶性循环。回复教会我的比帖子本身更多。
一位开发者反思社区在调试AI智能体方面的见解,强调通过记录工具调用和结构化输出验证器等技术实现系统可靠性。
@no_stp_on_snek: 如果你构建 multi-agent 或 mixture-of-agents 系统,请阅读 @dangerm00se 的文章。让我印象深刻的一个发现:甚至…
一位用户强调了 Hugh Madden 关于 multi-agent 系统的文章中的一个发现:即使是强大的仲裁者(GPT-5.5),如果先看到较弱代理的输出,也会产生偏差,从约 98% 的单独准确率下降到 7/9。
@levie:如果你想了解现实世界中智能体(agent)采用的动态,这篇文章是一个很好的起点。每个人都……
Aaron Levie 分享了关于现实世界 AI 智能体采用的见解,认为智能体更像是在管理一个流程,而不是聊天,并且需要工作流程的变革才能带来巨大收益。
@johnschulman2: 关于OpenAI智能体形成留言板:令人惊讶的是,它们发展出了如此强烈的“利他”驱动力来……
John Schulman评论了OpenAI智能体意外发展出利他行为,推测这可能源于在平行子智能体设置上进行强化学习,并采用团队级奖励。
引用 Andreas Påhlsson-Notini 的话
Andreas Påhlsson-Notini 批评当前 AI agent 表现出令人沮丧的“人性”——注意力涣散、来回讨价还价。