信念级联驱动LLM代理网络中的说服
摘要
本文提出一个受控测试平台,用于分析LLM代理网络中目标导向的说服,发现说服动态取决于网络拓扑、竞争、主题和模型先验。
查看缓存全文
缓存时间: 2026/08/27 09:16
# 信念级联如何驱动LLM代理网络中的说服力 来源:https://arxiv.org/html/2608.25152 作者:Haoyi Qiu、Genglin Liu、Pranav Narayanan、Venkit Kung-Hsiang Huang††(贡献相等),隶属:加州大学洛杉矶分校,Salesforce AI Research,邮箱:[[email protected]](mailto:) Saadia Gabriel、Chien-Sheng Wu、Nanyun Peng,隶属:加州大学洛杉矶分校,Salesforce AI Research,邮箱:[[email protected]](mailto:) ###### 摘要 多代理LLM系统越来越多地用于辩论答案、协调研究、模拟用户及调节信息流,使得代理间的说服成为一项基础但尚未充分衡量的能力。我们引入了一个受控测试环境,用于研究有目标的说服者如何在基于现实世界自我网络拓扑的LLM代理网络中改变所诱发的立场。在四个LLM骨干网络、五种图结构和五十五项政策声明的实验中,我们发现说服动态取决于拓扑结构、竞争、主题和模型先验的交互作用。此外,我们证明直接暴露可靠地预测了竞争场景中下一轮的立场变化,而同伴传递的影响虽小但可测量,表明未被指派执行说服任务的代理仍能传递说服力。最后,仅分析帖子文本会遗漏重要动态:计划的策略仅部分在执行消息中体现,行为选择可能与消息内容存在偏差,且被说服者很少明确陈述探测器所检测到的立场转变。这些结果主张将多代理说服评估视为一个轨迹和暴露层面的过程,利用信念探测、暴露溯源和行为日志来识别谁影响了谁,以及可见语言是否反映了潜在的立场移动。 参考标题 图1:我们设计的定向代理间说服测试环境概览。 顶部:两种设置(singlePR, dualPR),均以政策声明、有向图、PPR先验和骨干模型初始化;相对于肯定陈述测量被说服者的信念(红色=支持,蓝色=反对,灰色=中立)。 中部:每轮包含有限信息流、说服者发布、被说服者行动和词元概率信念探测。 底部:三个分析视角:RQ1结果(信念如何移动),RQ2渠道(直接与同伴介导),RQ3机制(计划/行动能否解释信念变化?)。 ## 1 引言 大型语言模型(LLM)代理日益依赖于一个代理影响其他代理的能力(Shen等,2023;Qian等,2024;Hong等,2024;Du等,2024;Chan等,2024;Zhu等,2025;Feng等,2026;Jiang等,2026):辩论代理相互批评候选答案,研究代理发现并调和证据,社交模拟代理则建模主张如何在社区中传播。**说服**是支撑这些互动的能力:它能帮助代理纠正错误假设、协调共同解释并达成更佳决策,但同一能力也具有双面性,可让协调一致的代理大规模传播操纵性叙事(Schroeder等,2026)。在本研究中,我们探讨当一个代理试图改变其他代理的诱发信念、偏好或行为时,**立场级联**是如何形成的。 尽管具有核心地位,代理间说服作为一个网络信念动态问题仍未得到充分探索。网络不仅仅是更大的对话:它决定了谁能看到哪些主张、谁可以传递这些主张,以及观察到的变化是源于直接说服、同伴放大还是对立叙事间的竞争。最终结果和总体平均值进一步掩盖了代理是否真正移动、是否在放大一致内容的同时保持稳定,或是否暂时跨越立场边界。此外,由于单一诱发态度对措辞和短暂语境敏感(Hase等,2021;Kabir等,2025;Levinstein和Herrmann,2025),一个最终答案可能误述代理的立场;因此,评估说服需要在固定探测下追踪跨轮次的信念,而非仅关注最终答案。 我们引入了一个用于网络化LLM代理间说服的受控测试环境,其基础是现实世界的自我网络拓扑以及近期关于LLM驱动社交模拟的研究(Hu等,2024;Gao等,2023;Piao等,2025b;Shirani和Bayati,2025)。每个代理位于有向图的一个节点上,接收有限信息流,执行社交行动,并在每轮后通过固定的词元概率立场探测器(Kuhn等,2023;Geng等,2024;Geng等,2025)重新评估。初始被说服者的立场通过**个性化PageRank**(PPR)从图位置推导得出,将先验立场与网络接近度相关联,无需手工编写的个性特征。我们实例化了两种设置:**单一说服者**设置(singlePR),其中一个目标导向的说服者倡导一个命题;**竞争说服者**设置(dualPR),其中两个说服者倡导对立立场。在五种图结构、五十五项政策声明和四种LLM的实验中,设计在保持交互协议固定的同时,变化了拓扑结构、初始立场、主题、模型和竞争性。图1概括了实验设置及我们的三个分析视角:结果、渠道和机制。 本文的贡献有三方面。(1)我们将**代理间说服**表述为LLM多代理系统的一个独特实证问题,并在一个受控仿真测试环境中将其操作化(§3)。(2)我们将其大规模实例化,实验设计涵盖了现实世界图拓扑、政策声明、模型族以及单一与竞争说服者模式(§4)。(3)利用该设计,我们就说服如何在网络中传播建立了三项发现:首先,定向说服会产生次级级联,因为后续放大说服者立场的代理通常已在立场探测中显示出显著的先期变化;其次,在竞争环境下,结果更符合特定主题和模型的先验倾向,而非固定的说服者身份或顺序,尽管先验和图位置在设计上保持耦合;第三,我们表明,多代理LLM系统中的说服不仅是影响力是否扩散,更关乎诱发的立场如何移动、哪些代理跨越了支持/反对阈值,以及哪些路径实际改变了探测结果。 ## 2 相关研究 #### LLM与说服。 关于LLM说服的研究表明,模型生成的信息可以在政治、健康、广告、政策、错误信息和阴谋信仰等场景中影响人类态度(Karinshak等,2023;Palmer和Spirling,2023;Breum等,2024;Xu等,2024;Carrasco-Farre,2024;Hackenburg等,2024;Jin等,2024;Gabriel等,2024;Costello等,2024;Ghosh,2024;Bai等,2025;Schoenegger等,2025)。近期研究考察了战略性、欺骗性、自发性和安全相关的说服,以及关于LLM说服力的综述和元分析(Noels等,2024;Burtell和Woodside,2023;Salvi等,2025;Matz等,2024;Furumai等,2024;Hou等,2024;Ramani等,2024;Timm等,2025;Ma等,2025;Liu等,2025b;Chen等,2025;Han等,2025;Kowal等,2025;Dönmez和Falenska,2025;Cheng和You,2025;Hölbling等,2025;Hackenburg等,2025;Yeo等,2026;Poungpeth等,2026)。这对于多代理系统至关重要,因为代理在人类检查结果之前越来越多地进行辩论、模拟用户并相互影响(Rahman等,2025;Liu等,2025a;Naous等,2025;Wu等,2026;Wynn等,2025;Guo等,2024;Noels等,2024;Burtell和Woodside,2023)。因此,我们的工作将说服视为多代理系统的一个基本元素:一个LLM代理试图改变其他代理的信念,我们测量该影响力如何在重复的社会暴露中传播、竞争或消散。 #### LLM观点与信念测量。 越来越多的工作探查LLM是否编码了稳定的信念、观点、价值观、情感、道德情感或其他可通过类似调查或心理测量提示诱发的潜在倾向(Hase等,2021;Santurkar等,2023;Röttger等,2024;Wright等,2024;He等,2024;Ye等,2025;Yao等,2024)。其他研究测量模型回应中的政治偏见、意识形态转变、内隐偏见、人口统计学对齐和全球观点对齐(Bang等,2024;Bai等,2024;Sun等,2024;Liu等,2026;Zhou等,2025;Bernardelle等,2025;Peng等,2026)。近期工作还强调,模型表观态度可能不稳定、对提示敏感,或在概念上难以解读为真实信念(Röttger等,2024;Kabir等,2025;Levinstein和Herrmann,2025;Hase等,2021;Santurkar等,2023;Kabir等,2025)。我们在这一文献基础上,通过在社会暴露期间重复测量信念,而非将模型观点视为在孤立互动之前或之后诱发的静态属性,来拓展研究。 #### LLM代理作为用户或社交模拟器。 LLM代理越来越多地被用作社交模拟体、用户模拟器以及建模类人行为和互动的通用社交模拟平台(Park等,2022;Park等,2023;Wang等,2023;Lin等,2023;Wang等,2026;Tang等,2025;Salem等,2025;Mou等,2026)。近期系统将这些模拟扩展到社交网络、大型社会和现实用户池,同时将其应用于流行病学、信任、协商和社会演化等领域(Gao等,2023;Piao等,2025b;Zhang等,2025;Williams等,2023;Wang等,2025;Xie等,2024;Noh和Chang,2024;Dai等,2024)。另一条研究线索考察了LLM代理之间的社交智能、交流互动、观点动态、两极分化和回音室形成(Li等,2023;Zhou等,2024;Wang等,2024;Gu等,2025;Piao等,2025a;Cau等,2025;Münker等,2026;Mou等,2026;Piao等,2025a;Cau等,2025)。我们在此基础上进行研究,但专注于级联式说服暴露下的信念变化,这需要追踪模拟内部的影响力,而非仅评估聚合的社交行为或经验现实主义。 ## 3 仿真基础设施 我们构建了一个受控的多代理仿真系统,用于研究定向影响。每次运行围绕一个陈述性命题展开,将代理置于有向图中,并追踪每个被说服者逐轮的信念轨迹。该仿真器抽象掉平台特定细节,以隔离**信念更新层**:有限的社会暴露、离散行动和重复的信念测量。图1给出了实验设置和轮次循环概览;实现细节见图5。
相似文章
基于概率信念追踪的多轮人类可说服性模型
本文介绍了PersuasionTrace,一个用于研究人机交互中多轮说服的框架,采用贝叶斯网络模拟目标来建模信念更新。该框架揭示了大语言模型在多种主题和模态下具有说服力,并且贝叶斯目标比普通大语言模型模拟器更符合人类信念动态。
Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs
This paper introduces adversarial persuasion, showing that RL-trained persuaders can collapse LLM accuracy to near zero with a single false argument, and that these tactics transfer across models including GPT-4o-mini, highlighting a critical safety vulnerability in LLM agents.
多智能体LLM商议中的隐藏锚点
本文把多智能体LLM商议建模成一个闭环动力系统,其中每个智能体都拥有隐藏的内部信念(锚点),该锚点持续牵引其观点。文章展示了如何仅从商议数据中恢复这个锚点,并解释了诸如观点逃逸初始信念凸包等现象。
通用型与专家型大型语言模型社交网络中的信念协同演化
本文介绍了 CoevolveSim,这是一个用于研究网络化通用型与专家型 LLM 智能体间信念传播的框架,表明专家模型和网络结构会影响共识与影响力动态。
使用多LLM代理模拟仇恨言论级联:经验基础、建模保真度与干预策略
本文研究了Bluesky上的仇恨言论级联,并使用多LLM代理进行模拟,发现此类模拟再现了立场单一文化和毒性增量方向等关键模式,且在密集网络上进行放大器定位可使仇恨内容减少7.5%–12.9%,且良性副作用较低。