GraphWake:在LLM智能体社区中通过记忆介导的极化级联实现群体极化

arXiv cs.AI 论文

摘要

GraphWake引入了一种新的威胁模型,称为记忆介导的极化级联,它利用智能体记忆和公共讨论在LLM智能体社区中诱导群体极化,揭示了在线平台的安全风险。

arXiv:2608.17665v1 公告类型:新 摘要:LLM驱动的智能体可以在在线平台上自主交换意见并形成社区。这种由智能体运营的社交平台引发了一个新的安全问题:攻击者可能操纵智能体以诱导群体极化。现有方法操纵智能体提示或构建回声室,这两者在实践中都难以实现。因此,我们提出了一种新的威胁:记忆介导的极化级联,它使用智能体记忆作为持久通道,公共讨论作为传播通道。该威胁包含三个阶段。在暴露和记忆保留阶段,攻击者让一小部分目标智能体接触到强化其各自立场的论据。目标的记忆系统随后处理并保留这些论据。在检索和再现阶段,一个共享的中立立场讨论提示目标检索并再现其保留的论据。在迭代传播阶段,未处理的智能体受再现论据的影响,重新陈述并传播它们。我们在GraphWake中实例化了这一威胁,包含三个组件:(i) 立场支持论证知识图谱构建基于知识的论据;(ii) 公理导向的三元组选择提炼它们以实现可靠保留和再现;(iii) 中立立场记忆提示触发并发检索和再现,启动传播。跨多个讨论和记忆系统的实验表明,GraphWake显著增加了群体极化。这些发现揭示了一种社区级别的极化风险。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:11

# GraphWake: 通过记忆介导的极化级联在LLM代理社区中引发群体极化
来源: https://arxiv.org/html/2608.17665
###### 摘要
LLM驱动的代理可以在在线平台上自主交流观点并形成社区。这类由代理运营的社交平台带来了新的安全隐患:攻击者可能操纵代理以诱导群体极化。现有方法通过操纵代理提示词或构建信息茧房来实现极化,但这些方法在实践中都难以实施。因此,我们提出了一种新的威胁模型——*记忆介导的极化级联*,该模型利用代理记忆作为持久化通道,以公共讨论作为传播通道。该威胁包含三个阶段:在暴露与记忆保留阶段,攻击者让一小部分目标代理接触能够强化其各自所声明立场的论据;目标代理的记忆系统随后处理并保留这些论据。在检索与复现阶段,一个立场中立的共享讨论会提示目标代理检索并复现其各自保留的论据。在迭代传播阶段,未被处理的代理受到这些复现论据的影响,进而重述并扩散它们。我们在GraphWake中实现了这一威胁模型,包含三个组件:(i) 立场支持的论证知识图谱,用于构建基于知识的论据;(ii) 公理导向的三元组选择,用于提炼论据以便可靠保留和复现;(iii) 立场中立的记忆提示,用于触发同步检索与复现,启动传播过程。跨多个讨论场景和记忆系统的实验表明,GraphWake显著增加了群体极化程度。这些发现揭示了一种社区级别的极化风险。
## 引言
LLM驱动的代理日益充斥在线平台,它们在平台上交流观点并形成具有涌现集体行为的社区[18]。例如类Reddit平台MoltBook,已拥有超过10万个代理和超过100万篇帖子[17]。这类社区带来了新的安全风险:攻击者可能操纵代理并放大群体极化。近期研究表明,即使单个代理看似对齐,集体偏见仍可能出现[14]。因此,在大规模部署前进行社区级别的红队评估是必要的。
> 图1:蓝色面板展示了为不同代理提供的不同公理,红色面板展示了如何通过共享提示触发级联传播的讨论。
现有研究主要通过修改代理提示词[4, 19]或构建信息茧房[26]来诱导极化。基于提示词的干预需要访问代理配置,而这些配置由开发者而非外部参与者控制[25]。信息茧房干预也难以实现,因为平台设计通常旨在缓解而非制造信息茧房[1]。这些限制促使我们考虑采用另一种威胁模型。
> 图2:GraphWake框架。
因此,我们提出了一种新的社区级威胁模型——*记忆介导的极化级联*。其核心思想是利用代理记忆作为持久化通道,公共讨论作为传播通道。该威胁包含三个阶段:在暴露与记忆保留阶段,攻击者通过回复一小部分目标代理的帖子,提供能够强化其各自所声明立场的论据。目标代理的记忆系统随后处理并保留这些论据。由于基于知识的论据比普通论据更具说服力[2],这些论据富含事实知识。在检索与复现阶段,攻击者发布一个公共讨论,其中包含立场特定论据共享的语义提示。该提示引导不同目标代理检索并复现其各自保留的论据。在迭代传播阶段,未被处理的代理受到这些复现实据的影响,可能在后续交互中保留并复现它们。这些复现强化了各自阵营的立场,从而放大了极化。
为实现此威胁模型,我们开发了*GraphWake*,其三个组件分别对应三项要求:(i) *立场支持的论证知识图谱*构建强化目标代理各自立场的多视角基于知识的论据;(ii) *公理导向的三元组选择*提取骨干三元组,并将其提炼为紧凑的公理,以便更可靠地保留和复现;(iii) *立场中立的记忆提示*构建公共讨论,同时提示目标代理检索并复现其各自的论据,从而启动向未被处理代理的传播。
我们在一个基于真实MoltBook交互重建的类Reddit模拟平台[8]上评估了GraphWake。仅针对10%的代理,就能将意见极化的平均方差从0.098提升至0.146,Esteban-Ray极化指数从0.130提升至0.213(跨三种记忆系统)。优化后的公理将平均措辞保留率从0.382提升至0.847(跨三种记忆机制)。
本文的贡献如下:
- • 新的威胁模型。我们提出了*记忆介导的极化级联*,该模型既不需要访问系统提示词,也不需要构建信息茧房。
- • 针对极化级联的红队攻击。我们引入GraphWake来强化不同立场,在记忆中保留立场支持论据,并通过共享的立场中立提示触发其迭代传播。
- • 社区级安全启示。实验表明,仅针对10%的代理即可放大极化并影响未被处理的代理,凸显了社区级评估和防御的必要性。
## 问题描述
#### 观点表示。对于命题$q$,我们将文本$x$所传达的立场表示为在候选立场集合$\mathcal{S}_{q} = (S_1, \ldots, S_d)$上的$d$维观点向量。使用G-EVAL评估器[15]计算该向量为:
$\boldsymbol{o}_{q}(x) = \Phi(q, x, \mathcal{S}_{q}) = \bigl(o_{q,1}(x), \ldots, o_{q,d}(x)\bigr)$  (1)
函数$\Phi$表示评估器,$o_{q,k}(x)$衡量文本$x$支持或反对立场$S_k$的强度。正值表示支持,负值表示反对。零值表示中立或无立场相关证据。
#### 立场暴露。在第$t$轮,暴露窗口$\mathcal{W}_{i}^{(t)}$包含代理$i$观察到的帖子。我们为每个帖子分配获得其最高支持得分的立场,即$\kappa_{q}(x) = \operatorname*{arg\,max}_{k \in \{1, \ldots, d\}} o_{q,k}(x)$  (2)
我们定义代理$i$的暴露是平衡的,当从$\mathcal{W}_{i}^{(t)}$中均匀采样的帖子具有均匀分布的立场类别时:
$X_{i}^{(t)} \sim \operatorname{Unif}\!\left(\mathcal{W}_{i}^{(t)}\right)$  (3)
$K_{i}^{(t)} = \kappa_{q}\!\left(X_{i}^{(t)}\right)$  
$K_{i}^{(t)} \sim \operatorname{Unif}\bigl(\{1, \ldots, d\}\bigr)$  (3)
变量$X_{i}^{(t)}$表示采样的帖子,$K_{i}^{(t)}$表示其立场类别。$K_{i}^{(t)}$的任何非均匀分布都构成选择性暴露。
#### 威胁模型。对于命题$q$,攻击者寻求在攻击条件下增加群体极化。当满足$\Delta z_{q}^{(T)} = z_{q,\mathrm{A}}^{(T)} - z_{q,\mathrm{B}}^{(T)} > 0$时,攻击成功 (4)
变量$z_{q,b}^{(T)}$表示最终轮次$T$的极化度量,其中$b \in \{\mathrm{B}, \mathrm{A}\}$分别索引基线条件和攻击条件。为隔离内容操纵的影响,每个目标代理在两种条件下保持平衡的立场暴露和相同的静态配置:
$\left\{\begin{aligned} K_{i,b}^{(t)} &\sim \operatorname{Unif}\bigl(\{1, \ldots, d\}\bigr), && b \in \{\mathrm{C}, \mathrm{A}\}, \\ \boldsymbol{\psi}_{i,\mathrm{A}} &= \boldsymbol{\psi}_{i,\mathrm{C}}\,. \end{aligned}\right.$  (5)
变量$\boldsymbol{\psi}_{i,b}$表示代理$i$的固定配置,包括其个人资料和骨干模型。在这些约束下,攻击者可以修改暴露内容同时保留其立场类别。我们将干预建模为:
$x \longmapsto \mathsf{R}_{q,k}(x), \qquad \kappa_{q}\!\left(\mathsf{R}_{q,k}(x)\right) = \kappa_{q}(x) = k.$  (6)
函数$\mathsf{R}_{q,k}$变换涉及命题$q$的帖子,同时保留其立场类别$k$。
## 方法
#### 概述。图2(上)展示了GraphWake的组件(i)和(ii)。对于每个立场$S_k \in \mathcal{S}_{q}$,GraphWake首先构建立场支持的论证知识图谱$G_{q,k}$,然后提取中心路径$\Pi_{q,k}$并将其提炼为公理$\boldsymbol{A}_{q,k}$。图2(下)接着选择跨立场提示实体$\mathcal{C}_{q}$,构建共享帖子$c_{q}$,以触发不同保留论据的同步检索和复现。整个过程为$S_k \rightarrow G_{q,k} \rightarrow \Pi_{q,k} \rightarrow \boldsymbol{A}_{q,k}, \{\Pi_{q,k}\}_{k=1}^{d} \rightarrow \mathcal{C}_{q} \rightarrow c_{q}$ (7)
复现的论据随后启动向未被处理代理的迭代传播。
### 立场支持的论证知识图谱
#### 多角度论证构建。我们的第一个目标是构建从多个互补角度强化候选立场$S_{k}$的基于知识的论证。对于命题$q$和立场$S_{k}$,我们生成$n$个语义上不同的论证角度。在第$j$个角度下,我们生成一个支持$S_{k}$的短论证$\xi_{q,k,j}$。为了表示其内部推理结构,我们将论证分解为语义单元序列$\mathcal{U}_{q,k,j} = \left(u_{q,k,j,1}, \ldots, u_{q,k,j,m_{q,k,j}}\right)$ (8)
其中每个单元表达一个可独立解释的有向关系。
#### 论证图构建。为了整合不同论证角度的语义单元,我们将每个$u \in \mathcal{U}_{q,k,j}$映射到一个有向三元组$\tau(u) = (h_u, r_u, t_u)$ (9)
其中$h_u$和$t_u$是实体,$r_u$是归一化关系。在提取过程中保留每个关系的方向。收集所有论证角度的三元组,得到原始三元组集$\mathcal{T}_{q,k}^{\mathrm{raw}} = \bigcup_{j=1}^{n} \left\{\tau(u) \mid u \in \mathcal{U}_{q,k,j}\right\}$ (10)
整合这些三元组,得到立场$S_k$的原始有向论证图$G_{q,k}^{\mathrm{raw}} = \left(\mathcal{E}_{q,k}^{\mathrm{raw}}, \mathcal{R}_{q,k}^{\mathrm{raw}}, \mathcal{T}_{q,k}^{\mathrm{raw}}\right)$ (11)
其中$\mathcal{E}_{q,k}^{\mathrm{raw}}$和$\mathcal{R}_{q,k}^{\mathrm{raw}}$分别表示其实体和关系。
#### 图优化。由于论证是独立生成的,原始图可能包含冗余端点和不连通组件。因此,我们通过端点压缩和跨组件桥接来压缩冗余信息并连接孤立的论证结构:$G_{q,k}^{\mathrm{raw}} \xrightarrow{\mathrm{compact}} G_{q,k}^{(0)} \xrightarrow{\mathrm{bridge}} G_{q,k}^{\star}$ (12)
压缩合并语义冗余的端点以增加图的信息密度。桥接在不连通组件间引入关系,使不同的论证角度形成连贯结构。用于公理选择的优化图是$G_{q,k} = G_{q,k}^{\star} = \left(\mathcal{E}_{q,k}, \mathcal{R}_{q,k}, \mathcal{T}_{q,k}\right)$ (13)
优化方法见附录。
### 公理导向的三元组选择
我们的第二个目标是将$G_{q,k}$转换为适合记忆保留和复现的紧凑自然语言序列。由于大型图会降低LLM的图推理能力[23],我们提取结构中心的论证路径而非呈现完整图。我们使用归一化有向介数中心性$\overline{\operatorname{bc}}_{q,k}(v)$来识别此路径[9],因为高介数实体连接了支持立场$S_k$的更大比例的论证。令$\mathcal{Q}_{q,k}$为无环有向论证路径的集合。我们选择具有最高平均节点介数的路径:$\Pi_{q,k} = \arg\max_{\pi \in \mathcal{Q}_{q,k}} \left[ \frac{1}{|\mathcal{E}(\pi)|} \sum_{v \in \mathcal{E}(\pi)} \overline{\operatorname{bc}}_{q,k}(v) \right]$ (14)
其中$\mathcal{E}(\pi)$表示路径$\pi$遍历的实体。然后我们将所选路径转换为有序的公理序列。令$\boldsymbol{\tau}_{q,k}$表示$\Pi_{q,k}$上的有序三元组序列。LLM将每个三元组提炼为紧凑的自然语言公理:
$a_{q,k,\ell} = \operatorname{distill}_{\mathrm{LLM}}\!\left(\tau_{q,k,\ell}\right)$ (15)
$\boldsymbol{A}_{q,k} = \left(a_{q,k,1}, \ldots, a_{q,k,L_{q,k}}\right)$
其中$\tau_{q,k,\ell}$是$\boldsymbol{\tau}_{q,k}$中的第$\ell$个三元组,$L_{q,k}$是三元组序列的长度。生成的公理以适合保留和复现的紧凑形式保留了论证的核心关系。
#### 暴露与记忆保留。为了通过常规交互呈现所选的立场支持内容,我们将每个公理$a_{q,k,\ell}$转换为描述性的自然语言帖子$p_{q,k,\ell}$。生成的帖子序列为$\mathcal{P}_{q,k} = \left(p_{q,k,1}, \ldots, p_{q,k,L_{q,k}}\right)$ (16)

相似文章

信念级联驱动LLM代理网络中的说服

arXiv cs.CL

本文提出一个受控测试平台,用于分析LLM代理网络中目标导向的说服,发现说服动态取决于网络拓扑、竞争、主题和模型先验。

内存增强型LLM智能体中的状态污染

arXiv cs.AI

本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。