AI代理的规范执行:在多智能体系统中稳健塑造行为

arXiv cs.AI 论文

摘要

本文研究了在多智能体系统中利用规范执行机制塑造语言模型智能体行为的方法。作者提出了稳健机制,该机制随时间评估智能体可靠性,并应用逐步升级的惩罚来抵抗利用。

arXiv:2607.09766v1 公告类型:新 摘要:AI代理越来越多地被部署在共享环境中,它们追求多样化目标并竞争奖励。这种多智能体竞争可能导致为个人利益而损害集体利益的行为——例如,营销代理可能因争夺社交媒体上的参与度而发布误导性内容。人类社会通过规范来约束可接受的行为,并通过检测和惩罚违规的执行机制来支持这些规范。受此启发,我们研究了针对语言模型智能体的规范执行机制。我们发现,即使没有明确训练或提示,简单的执行机制也会被不对齐的智能体利用以获取竞争优势。因此,我们将注意力转向设计更稳健的机制,并确定了两个关键要素:随时间评估每个智能体的可靠性,并根据反复不当行为升级惩罚来更新这一评估。在三个模拟环境和多种智能体群体中,基于这些原则构建的机制能够抵抗利用,同时仍以与基线相当或更低的成本惩罚规范违反行为。我们的结果将规范执行机制定位为塑造智能体行为的可扩展杠杆,但前提是它们的设计要预见到自身会成为所治理系统的一部分。我们的代码和数据可在 https://yaowenye.com/norm-enforcement 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:17

# AI代理的规范执行:在多智能体系统中稳健塑造行为
来源:https://arxiv.org/abs/2607.09766  
查看PDF(https://arxiv.org/pdf/2607.09766)

> **摘要**:AI代理正越来越多地部署在共享环境中,它们追求多样化的目标并争夺奖励。这种多代理竞争可能导致以集体利益为代价的个人获益行为——例如,营销代理可能会为了在社交媒体上争夺参与度而发布误导性内容。人类社会通过规范来约束可接受的行为,并辅以检测和惩罚违规行为的执行机制来解决此类问题。受此启发,我们研究了语言模型代理的规范执行机制。我们发现,即使未经过明确训练或提示,简单的执行机制也会被不端代理利用以获取竞争优势。因此,我们将注意力转向设计更稳健的机制,并确定了两个关键要素:随时间估计每个代理的可靠性,以及针对重复不当行为以逐步升级的惩罚来更新此估计。在三个模拟环境和多种代理群体中,基于这些原则构建的机制能够抵抗利用,同时以与基线相当或更低的成本惩罚规范违规行为。我们的结果表明,规范执行机制是塑造代理行为的可扩展杠杆,但前提是其设计需要预见到自身将成为所治理系统的一部分。我们的代码和数据可在以下网址获取:此 https URL(https://yaowenye.com/norm-enforcement)。

## 提交历史

来自:Yaowen Ye [查看邮件(https://arxiv.org/show-email/246e3529/2607.09766)] **\[v1\]** 2026年7月7日星期二 06:40:14 UTC(389 KB)

相似文章

学习社会规范增强动态人机协调中的兼容性

arXiv cs.AI

本文研究了AI代理如何从人类行为中学习显式社会规范,以改善动态交互中的协调,并以人-车场景作为测试平台。所提出的基于规范的大语言模型在性能上显著超越基线策略及人类-人类交互。