更多欺骗:混合动机LLM多智能体系统中的目标错位

arXiv cs.AI 论文

摘要

本文提出了一个框架,利用社交推理游戏《狼人杀》来评估LLM多智能体系统中的目标错位,发现细微的目标错位可能深刻影响集体决策。

arXiv:2607.26120v1 公告类型:新 摘要:由大型语言模型(LLM)驱动的多智能体系统越来越多地部署在混合动机环境中,在这种环境中,智能体在信息不对称和战略欺骗下运作,因为目标相互冲突或隐藏。在这些情境下,与集体目标的错位成为核心关切。我们提出了一个新颖的框架,利用社交推理游戏《狼人杀》来评估目标错位,即修改单个智能体的目标同时保留其分配的角色。我们跨越四个不同模型家族和规模的LLM、四种玩家角色和三种目标表述,对智能体的内部推理及其公开的廉价交谈行为(即无成本、非约束性的交流,不直接影响智能体的效用)进行了双重分析,并辅以对游戏结果的分析。我们的结果表明,目标错位会破坏固有对抗性环境中的结果,这种效应因信息不对称和专业化角色而加剧。虽然被入侵的智能体始终会发展出独特的、依赖于目标的推理策略,但这些适应在其公开行为中基本不可见。更广泛地说,我们的发现表明,即使是细微的目标错位也能深刻影响集体决策,这凸显了为基于LLM的多智能体系统制定有效缓解策略的必要性。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:00

# 更多欺骗:混合动机LLM多智能体系统中的目标错位
Source: https://arxiv.org/abs/2607.26120
View PDF (https://arxiv.org/pdf/2607.26120)

> 摘要:大语言模型(LLM)驱动的多智能体系统日益部署于混合动机环境中,此类环境中智能体在信息不对称条件下运行,并因目标冲突或隐藏目标而需要进行策略性欺骗。在此类情境下,与集体目标错位成为核心关切。我们提出了一种新颖框架,利用社交推理游戏狼人杀(Werewolf)来评估目标错位,做法是在保持单个智能体被分配角色不变的同时修改其目标。我们横跨四个不同模型家族和规模的LLM、四种玩家角色以及三种目标设定,对智能体的内部推理与其公开廉价交谈(cheap-talk)行为(即不直接作用于智能体效用的无成本、非约束性沟通)进行双重分析,并辅以游戏结果分析。我们的结果表明,目标错位会破坏固有对抗环境中的结果,而信息不对称和专门化角色会加剧这一效应。被篡改目标的智能体始终会发展出依赖目标的独特推理策略,但这些适应性变化在其公开行为中基本不可见。更广泛地说,我们的研究提示,即使是微妙的目标错位也可能深刻影响集体决策,凸显了为基于LLM的多智能体系统制定有效缓解策略的必要性。

## 提交历史

来自:Marylou Fauchard [查看电子邮件](https://arxiv.org/show-email/d21dd8ad/2607.26120) **[v1]**Tue, 28 Jul 2026 17:48:54 UTC (15,128 KB)

相似文章

当伦理与利益相悖:道德困境中的LLM智能体

arXiv cs.CL

本文介绍了MoralSim,用于评估LLM智能体在道德冲突的社会困境中的行为表现,其中道德行为与利润激励相冲突,研究发现没有模型能始终保持道德,合作率差异很大。