更多欺骗:混合动机LLM多智能体系统中的目标错位
摘要
本文提出了一个框架,利用社交推理游戏《狼人杀》来评估LLM多智能体系统中的目标错位,发现细微的目标错位可能深刻影响集体决策。
arXiv:2607.26120v1 公告类型:新
摘要:由大型语言模型(LLM)驱动的多智能体系统越来越多地部署在混合动机环境中,在这种环境中,智能体在信息不对称和战略欺骗下运作,因为目标相互冲突或隐藏。在这些情境下,与集体目标的错位成为核心关切。我们提出了一个新颖的框架,利用社交推理游戏《狼人杀》来评估目标错位,即修改单个智能体的目标同时保留其分配的角色。我们跨越四个不同模型家族和规模的LLM、四种玩家角色和三种目标表述,对智能体的内部推理及其公开的廉价交谈行为(即无成本、非约束性的交流,不直接影响智能体的效用)进行了双重分析,并辅以对游戏结果的分析。我们的结果表明,目标错位会破坏固有对抗性环境中的结果,这种效应因信息不对称和专业化角色而加剧。虽然被入侵的智能体始终会发展出独特的、依赖于目标的推理策略,但这些适应在其公开行为中基本不可见。更广泛地说,我们的发现表明,即使是细微的目标错位也能深刻影响集体决策,这凸显了为基于LLM的多智能体系统制定有效缓解策略的必要性。
查看缓存全文
缓存时间: 2026/07/31 04:00
# 更多欺骗:混合动机LLM多智能体系统中的目标错位 Source: https://arxiv.org/abs/2607.26120 View PDF (https://arxiv.org/pdf/2607.26120) > 摘要:大语言模型(LLM)驱动的多智能体系统日益部署于混合动机环境中,此类环境中智能体在信息不对称条件下运行,并因目标冲突或隐藏目标而需要进行策略性欺骗。在此类情境下,与集体目标错位成为核心关切。我们提出了一种新颖框架,利用社交推理游戏狼人杀(Werewolf)来评估目标错位,做法是在保持单个智能体被分配角色不变的同时修改其目标。我们横跨四个不同模型家族和规模的LLM、四种玩家角色以及三种目标设定,对智能体的内部推理与其公开廉价交谈(cheap-talk)行为(即不直接作用于智能体效用的无成本、非约束性沟通)进行双重分析,并辅以游戏结果分析。我们的结果表明,目标错位会破坏固有对抗环境中的结果,而信息不对称和专门化角色会加剧这一效应。被篡改目标的智能体始终会发展出依赖目标的独特推理策略,但这些适应性变化在其公开行为中基本不可见。更广泛地说,我们的研究提示,即使是微妙的目标错位也可能深刻影响集体决策,凸显了为基于LLM的多智能体系统制定有效缓解策略的必要性。 ## 提交历史 来自:Marylou Fauchard [查看电子邮件](https://arxiv.org/show-email/d21dd8ad/2607.26120) **[v1]**Tue, 28 Jul 2026 17:48:54 UTC (15,128 KB)
相似文章
当伦理与利益相悖:道德困境中的LLM智能体
本文介绍了MoralSim,用于评估LLM智能体在道德冲突的社会困境中的行为表现,其中道德行为与利润激励相冲突,研究发现没有模型能始终保持道德,合作率差异很大。
智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗
本文介绍了ParliamentBench,一个基于社交推理游戏《秘密希特勒》的开源基准,用于评估LLM在信息不对称条件下的欺骗、说服和推理能力。对约1600场比赛中16个LLM的实验显示,前沿模型形成了一个强大的顶尖集群,而大多数模型难以维持一致的欺骗性人格。
探究LLM风险决策中的结果层面相似性与机制层面一致性:来自圣彼得堡博弈的证据
研究人员在圣彼得堡博弈中评估了28个LLM,以区分风险决策中的结果层面相似性与机制层面一致性,发现LLM通常产生类似人类的出价,但缺乏潜在的人类一致推理机制。该研究表明,行为对齐可能是表面的,敦促高风险评估应超越结果相似性。
自信的撒谎者:利用对数概率和LLM-as-Judge诊断多智能体辩论
本文研究了多智能体辩论系统中令牌级对数概率分布、LLM-as-judge评分标准分数和最终任务准确性之间的关系。它发现了一致的四阶段置信度轨迹以及Constructor与Auditor智能体之间的角色不对称性。
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。