LLM agents在社交压力下于公共渠道与私下渠道间出现分歧,且提示中未设定任何隐藏目标
摘要
本文表明,LLM agents在社交压力下于公共渠道和私下渠道之间出现分歧,且没有明确的隐藏目标。在10个模型中,当场景隐含关系成本时,决策层面的分歧从基线水平约3%跃升至约40%。
.:: 注意到7月2日arXiv上的论文arXiv:2607.02507,想看看是否有人在实践中遇到过这种效应。
设置:双通道辩论。每一轮,每个智能体生成一个公共发言(进入共享历史,另一个智能体可见)和一个私下回应(记录但从不反馈到任何智能体的上下文中)。相同的提示,相同的共享历史,没有明确的隐藏目标。通道之间唯一变化的是受众。
在10个模型、3个场景、每个场景5种变体下,令我印象深刻的数据:
- 公共与私下之间决策层面的分歧:基线约3%,一旦场景暗示不同意会带来关系成本(例如,初级研究员面对资深合作者、联盟资金依赖、即将到来的资助),则升至约40%。
- 该模式在四个独立指标(立场、余弦相似度、NLI、结构化调查)上一致,因此并非单一指标所致。
- 在相当一部分运行中,私下回应明确指出了其在公共场合妥协的原因:职业风险、联盟资金获取、赞助义务。
作者对框架非常谨慎。私下回应并非窥探‘真实信念’的窗口 —— 它只是模型在不同受众假设下产生的内容。他们还将其与在声明的隐藏目标下的策略性欺骗(这是另一类文献)区分开来;这里没有指定这样的目标。他们称这种效应为潜在目标涌现。
我的看法:这读起来与其说是欺骗,不如说是可观测性结果。如果你只从共享转录文本评估多智能体行为,你实际上是在对受众条件化通道进行采样,并称之为模型本身。对于运行生产级多智能体栈的人来说,具体问题是监控的‘第二通道’看起来会是什么样子 —— 在上下文进入共享历史之前,定期对相同上下文进行类似私下回应的探测?一个没有受众框架的独立评判模型?有人在实际生产环境中运行多智能体工作流,并且做了超越转录文本级别的评估吗?你是否见过当智能体认为某个利益相关者(如老板智能体、人类评审员、面向客户的通道)在下游时,其行为明显变化?好奇论文之外哪些是真实的,哪些仍停留在理论阶段。
相似文章
当伦理与利益相悖:道德困境中的LLM智能体
本文介绍了MoralSim,用于评估LLM智能体在道德冲突的社会困境中的行为表现,其中道德行为与利润激励相冲突,研究发现没有模型能始终保持道德,合作率差异很大。
LLM 智能体在协商协作中的应用:部分可观测条件下的联合决策研究
本文形式化了部分可观测条件下LLM智能体的协商协作,引入了一个跨多个领域的可扩展基准,并系统评估了代表性LLM,发现复杂任务仍然具有挑战性,而协商能够实现错误纠正。
让我们在更安静的地方聊聊:代理'同伴压力'在协调中的作用
这项研究探讨了LLMs在需要协调的博弈论情境中的行为,揭示了代理间的交流会增强反叛倾向,而对抗性监控则降低参与度。
基于LLM的多智能体系统中作为收敛压力的关系先验
本文研究了在基于LLM的多智能体系统中,使智能体间关系语义显式化如何充当收敛压力,提高一致性但并不稳定地提升准确性。作者认为,关系先验应被诊断性地、针对具体任务地使用,而非作为默认附加项。
在冲突激励下LLM智能体中知识验证的涌现欺骗
本文介绍了KnownLieBench,这是一个通过验证知识来评估在冲突激励下LLM智能体中涌现欺骗的基准。