AI代理的规范执行:在多智能体系统中稳健塑造行为
摘要
本文研究了在多智能体系统中利用规范执行机制塑造语言模型智能体行为的方法。作者提出了稳健机制,该机制随时间评估智能体可靠性,并应用逐步升级的惩罚来抵抗利用。
arXiv:2607.09766v1 公告类型:新
摘要:AI代理越来越多地被部署在共享环境中,它们追求多样化目标并竞争奖励。这种多智能体竞争可能导致为个人利益而损害集体利益的行为——例如,营销代理可能因争夺社交媒体上的参与度而发布误导性内容。人类社会通过规范来约束可接受的行为,并通过检测和惩罚违规的执行机制来支持这些规范。受此启发,我们研究了针对语言模型智能体的规范执行机制。我们发现,即使没有明确训练或提示,简单的执行机制也会被不对齐的智能体利用以获取竞争优势。因此,我们将注意力转向设计更稳健的机制,并确定了两个关键要素:随时间评估每个智能体的可靠性,并根据反复不当行为升级惩罚来更新这一评估。在三个模拟环境和多种智能体群体中,基于这些原则构建的机制能够抵抗利用,同时仍以与基线相当或更低的成本惩罚规范违反行为。我们的结果将规范执行机制定位为塑造智能体行为的可扩展杠杆,但前提是它们的设计要预见到自身会成为所治理系统的一部分。我们的代码和数据可在 https://yaowenye.com/norm-enforcement 获取。
查看缓存全文
缓存时间: 2026/07/14 04:17
# AI代理的规范执行:在多智能体系统中稳健塑造行为 来源:https://arxiv.org/abs/2607.09766 查看PDF(https://arxiv.org/pdf/2607.09766) > **摘要**:AI代理正越来越多地部署在共享环境中,它们追求多样化的目标并争夺奖励。这种多代理竞争可能导致以集体利益为代价的个人获益行为——例如,营销代理可能会为了在社交媒体上争夺参与度而发布误导性内容。人类社会通过规范来约束可接受的行为,并辅以检测和惩罚违规行为的执行机制来解决此类问题。受此启发,我们研究了语言模型代理的规范执行机制。我们发现,即使未经过明确训练或提示,简单的执行机制也会被不端代理利用以获取竞争优势。因此,我们将注意力转向设计更稳健的机制,并确定了两个关键要素:随时间估计每个代理的可靠性,以及针对重复不当行为以逐步升级的惩罚来更新此估计。在三个模拟环境和多种代理群体中,基于这些原则构建的机制能够抵抗利用,同时以与基线相当或更低的成本惩罚规范违规行为。我们的结果表明,规范执行机制是塑造代理行为的可扩展杠杆,但前提是其设计需要预见到自身将成为所治理系统的一部分。我们的代码和数据可在以下网址获取:此 https URL(https://yaowenye.com/norm-enforcement)。 ## 提交历史 来自:Yaowen Ye [查看邮件(https://arxiv.org/show-email/246e3529/2607.09766)] **\[v1\]** 2026年7月7日星期二 06:40:14 UTC(389 KB)
相似文章
构建能够强制执行其行为的智能体
讨论构建能够强制执行特定行为或约束的AI智能体的方法,重点在于对齐和安全机制。
学习社会规范增强动态人机协调中的兼容性
本文研究了AI代理如何从人类行为中学习显式社会规范,以改善动态交互中的协调,并以人-车场景作为测试平台。所提出的基于规范的大语言模型在性能上显著超越基线策略及人类-人类交互。
责怪模型无法修复你的工作流——关于AI智能体结构性约束的白皮书
一份白皮书,识别了AI智能体工作流中的24种失效模式,并提出了一种包含三层约束、任务图和验证的结构性约束架构,以及一个基于Common Lisp的参考实现。
语言模型智能体群体中的涌现语言:从词元效率到规避监管
本文研究了自主LLM智能体在Moltbook平台上相互提出的涌现语言,发现有些语言专门设计用于规避人类监管,且可通过简短描述在上下文中学习。这些发现引发了对智能体群体监控的安全担忧。
AI智能体之间的信任:测量形成、破裂与恢复,及其对多智能体系统治理的启示
本文基于合作生存游戏中的成本验证,提出了一种衡量AI智能体之间信任的行为测量方法,研究了六个前沿模型快照中信任的形成、破裂与恢复。研究发现不同模型在信任校准上存在差异,且持续过度验证与犹豫不决而非安全性相关。