学习用于社会文化任务的向量符号模型

arXiv cs.CL 论文

摘要

本文提出了一种用于ACT-R认知架构的向量符号陈述性记忆系统,以更好地表示社会文化对决策的影响,并通过内隐联想测试进行了验证。

arXiv:2608.02807v1 公告类型:新论文 摘要:我们如何更好地表示社会文化结构对计算认知模型中决策的影响?建模这种影响需要遍历多个语义表示层次,然而,对于建模者来说,并不立即清楚哪些表示层次对给定情境最为重要。尽管大型语言模型和基于认知的语料库模型可以通过共现来表示广泛的语义关联,但为了确定文化关联如何塑造决策,应考虑自我表征在记忆中的作用。我们提出了一种用于ACT-R认知架构的陈述性记忆系统,通过向量符号自编码器在多个层次上表示语义关联。我们使用简单的HRR操作来编码情景记忆,使其不同于从文本中提取的语义记忆向量,从而为记忆请求生成最终的块激活。我们使用种族情境化的内隐联想测试(IAT)的ACT-R认知模型来测试这一新的陈述性记忆系统。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# 学习用于社会文化任务的向量符号模型
来源:https://arxiv.org/html/2608.02807
Meera Ray \(mfr5832@psu\.edu\) 宾夕法尼亚州立大学计算机科学与工程系,W209 Westgate Building, University Park, PA 16802, USA  
Swapnika Dulam \(szd5775@psu\.edu\) 宾夕法尼亚州立大学计算机科学与工程系,W209 Westgate Building, University Park, PA 16802, USA  
Christopher L\. Dancy \(cdancy@psu\.edu\) 宾夕法尼亚州立大学工业与制造工程系,M310 Leonhard Building, University Park, PA 16802, USA  

###### 摘要

我们如何更好地在计算认知模型中表示社会文化结构对决策的影响?对这一影响进行建模需要跨越多个语义表征层次,但建模者并不容易立即判断在给定情境下哪些表征层次最为关键。尽管大型语言模型和基于认知语料库的模型可以通过共现关系表示广泛的语义关联,但为了确定文化关联如何塑造决策,还应考虑自我表征在记忆中的作用。我们提出了一种用于 ACT-R 认知架构的陈述性记忆系统,它通过向量符号自动编码器在多个层次上表示语义关联。我们使用简单的 HRR 运算,将情景记忆与从文本中提取的语义记忆向量进行不同方式的编码,从而为记忆请求生成最终的组块激活。我们使用种族情境化内隐联想测验(IAT)的 ACT-R 认知模型来测试这一新的陈述性记忆系统。

关键词:ACT-R、认知架构、VSA、向量符号架构、向量符号代数、社会文化、IAT、内隐联想测验、联结主义

## 引言

在本文中,我们旨在为需要社会带表征的任务构建一个向量符号扩展的 ACT-R 模型。ACT-R 是一种混合架构,使用知识的符号表征,并通过严格拟合人类数据而建立的亚符号数值来访问这些表征。此外,ACT-R 是开源的,便于修改架构中所需的模块,并且拥有活跃的开发社区。

## 相关工作

### ACT-R 中的陈述性记忆

标准 ACT-R 中的陈述性记忆系统包含情景记忆和语义记忆系统(尽管并未将这两种陈述性记忆类型明确表示为独立实体),并用于显式存储记忆及其相关特征,这些记忆在陈述性模块中以符号形式表示为带有槽及其对应值的组块。这些记忆根据任何给定情境下的环境线索进行检索,并由亚符号值(?,?)引导。当前环境线索与陈述性记忆之间的关联强度决定了检索能否发生。这些线索存储在各模块专用的缓冲区中,模块之间的通信由中央程序性记忆(产生式)系统促进。

尽管系统性地复制人类认知的益处可以应用于各种场景,但 ACT-R 中表示的知识大多是特定于任务的,通常由建模者手动设置。这在 ACT-R 架构内部造成了知识表示方面的严重瓶颈。?(?)等人已将全息表示适配为替代 ACT-R 的默认陈述性记忆系统,他们称之为全息陈述性记忆(HDM)。HDM 使用分布语义学,以更可扩展的方式在 ACT-R 陈述性记忆中存储陈述性记忆组块。

### 表征种族化的世界

个体不仅根据直接证据或仅凭个人偏见行事,还会在“提供或促进特定种族化方式来处理和看待世界的文化世界”的背景下行动(?, ?)。人们通过“选择性偏好”来再生产他们的世界观。?(?)将文本陈述的认知解释建模为向量符号语义空间。

这种基于向量的语义空间之所以有用,是因为概念之间的关联(例如,通过相似性表示)可以被设置为 ACT-R 陈述性记忆中组块之间的关联强度。因此,将种族图式(例如,?, ?)表示为语义空间,将为以面向过程的方式理解此类图式对行为的影响提供机会。如果能有效地映射种族图式的语义系统与用于即时决策的记忆组块之间的相互作用,就可以开始建模社会文化世界观如何产生选择性偏好。

### 向量符号架构

向量符号架构(或称向量符号代数,VSA)旨在结合联结主义和符号主义的许多优点<sup>1</sup>。其中一种 VSA 是全息简化表示(Holographic Reduced Representation,?, ?),与其他 VSA(如张量积表示)相比,它的优势在于两个向量“符号”的绑定操作会产生一个大小相同的向量。VSA 已被用于对语义记忆中概念的层级表示进行建模(?, ?, ?)。全息陈述性记忆实现了 ACT-R 的陈述性记忆,并从文本标记中学习概念的表示(?, ?)。然而,从文本中学习一种与结构化、符号化的 ACT-R 陈述性记忆查询直接兼容的层级语义表示,仍然是一个开放问题。

有证据表明,大脑的默认模式网络(DMN)在概念反思期间被激活,它会检索结构化知识并在特定参考框架内构建思想(?, ?)。这些表示似乎是跨模态的(即不特定于书面语言、音频或视觉)。不同的句子式和映射式<sup>2</sup>概念表示既可存储又互为补充。句子式表示源于思维语言(LoT),需要具备根据结构化规则(如形式化定义的语言)从旧概念创建新概念的能力。而映射式表示则在复杂概念往往无法仅通过结构化语法生成时是必需的。组合两个词可能需要遍历概念空间才能恰当地表示它们;仅仅为任意两个概念以相同方式分配角色和绑定并不足够。事实上,既存在交集性合取(对象内绑定),也存在集体性合取(跨对象收集)。用 VSA 的术语来说,有些概念需要子概念之间的绑定,而另一些则需要更高层次概念的捆绑。

然而,尽管组合需要上下文,但来自 BOLD 数据的证据表明表示存在时间上的复用。因此,句子式和映射式表示必须发挥作用。确保这两种表示保持区分的一个良好基础是在角色(概念所充当的结构化参数类型)和填充值(概念本身的含义)之间强制正交性。另一个重要概念是必须能够对“高度抽象的先前知识”进行快速概率推断,而不是在每次记忆检索请求时都遍历概念空间或一列情节来手动构建思想(?, ?, ?)。

在这里,我们提出一种自动编码器模型,它使用伪正交向量保持角色和填充值的内部表示,并创建多层级情节向量,从而允许向量之间进行不同层次的交互,如图1所示(https://arxiv.org/html/2608.02807#Sx3.F1)。

## 方法

*图1:我们的模型概览*

### 角色自动编码

给定一个标记序列 i=1...n,我们将其传递给 BERT 编码器,得到编码 \(Enc_i \in \mathbb{R}^d\),其中 \(d\) 是编码维度。我们定义角色池 \(ROLES_i\),它们是按 (?, ?) 中方法初始化的幺正向量,用于层次 \(i \in 1...L\)。这些向量与网络输入无关——我们假设,在给定足够训练样本的情况下,自动编码器会选择某些向量来适配某些角色。这些“角色”不仅限于表示句子中与其他标记的语法或语义角色——它们还可以表示本体论信息和特定概念的典型属性。在角色变换器块(role-former blocks)结束时(下文将解释),输出将与输入进行比较,以查看原始信息保留了多少(见10 (https://arxiv.org/html/2608.02807#Sx3.E10))。整个自动编码器流程如图2所示(https://arxiv.org/html/2608.02807#Sx3.F2)。

我们将每个标记的 LLM 输出传递给一个全连接线性层,其权重矩阵为 \(W \in \mathbb{R}^{d \times |ROLES_{i,j}|}\)。对每个长度为 \(|ROLES_{i,j}|\) 的向量,我们应用 softmax 来获得每个池中每个向量的权重,我们称之为 \(R_i^t\)。我们计算 \(R_i^t\) 与 \(ROLES_{i,j}\) 之间的点积,将池视为具有预定义顺序的矩阵,得到角色叠加 \(RS_{i,j}^1\)。在最终损失函数中(将在本节末尾解释),会有一项惩罚 \(R_i^t\) 中权重分散过宽的项,以确保每一层有意义地“选择”一小部分角色。然而,我们并不简单地取与 \(R_i^t\) 最大值对应的单个角色向量,以允许意义上的细微差别;例如,一个词在一种情况下可以是动词的宾语,在另一种情况下又可以是动词的主语。

*图2:角色变换器流水线。紫色高亮部分属于图1和图3中的流水线,灰色部分仅用于训练。如图3(https://arxiv.org/html/2608.02807#Sx3.F3)所示的角色变换器块会重复 L 次。这里的 FC 表示全连接线性层。*

随着我们逐层深入,我们可能希望保持每个标记的多层级 HRR 表示,以便稍后可以方便地按层分离。有证据表明,“慢速”和“快速”检索与推理需要多个层级的表示(?, ?, ?, ?)。网络在每一步创建的 HRR 可能并不同时适合此任务,因为角色的组合方式以及随着网络深入早期层次会衰减。因此,对于需要保存特定输入的所有表征层次的情况,我们维护一个累积输出 HRR 向量 \(Multi_i, i \in 1...n\),该向量将在后续步骤中使用。这个 \(Multi\) 向量在自动编码器训练中不会被使用,因为我们主要使用最终层输出(而非中间层激活)来优化损失。但是,当处理查询和情节时,我们确实会保存 \(Multi\),以便计算查询-情节概念相似度来估计组块激活。

我们将 \(RS_{i,j}^1\) 相加,得到单一的角色叠加 \(RS_i\)。这是添加到 \(Multi\) 的第一级输出:

\[
Multi \longleftarrow Multi + RS_i \odot \mathrm{SYM}_i \odot L^1 \tag{1}
\]

其中 \(\mathrm{SYM}_i\) 是一个固定的 HRR 向量,映射到标记 \(i\)。\(L\) 是一个固定的 HRR 向量,指代层次,我们取 \(L^i\) 表示层次索引 \(i=1\)。从现在起,我们使用 \(\odot\) 表示绑定操作(?, ?)。我们现在将 \(RS_i\) 传入第一个“角色变换器”块,如图3(https://arxiv.org/html/2608.02807#Sx3.F3)所示。

角色变换器接收输入 \(RS_i^t\),表示第 \(t\) 层的第 \(i\) 个标记。我们按照标准自注意力模块(?, ?)定义键、查询和值:

\[
\begin{aligned}
k^{(i)} &= RS_i^t W_k \tag{2} \\
v^{(i)} &= RS_i^t W_v \tag{3} \\
q^{(i)} &= RS_i^t W_q \tag{4} \\
K &= \operatorname{concat}(k^{(1)}...k^{(n)}) \tag{5}
\end{aligned}
\]

其中 \(W_k\) 和 \(W_h\) 在 \(\mathbb{R}^{N \times H}\) 中,\(W_v \in \mathbb{R}^{N \times |ROLES^{t+1}|}\),隐藏大小为 \(H\),HRR 维度为 \(N\)。

然而,我们的目标不同于普通 transformer,因为我们不满足于每个序列只计算一个标量权重——我们期望每个序列得到一个长度为 \(|ROLES^{t+1}|\) 的向量,以便知道哪个角色描述了标记 \(i\) 与其他标记之间以及标记 \(i\) 与前一层次表示之间的关系。我们可以为每个可能的角色设置一个注意力头,但这会对每一层可用的角色数量造成严重的计算限制。相反,我们希望将 \(R_{i \xrightarrow{} \cdot}^{t+1}\)(即标记 \(i\) 与每个标记之间的角色权重)作为矩阵运算来计算。因此,我们使用 \(K^T q^{(i)}\) 与 \(v^{(i)}\) 的外积,而不是通常的内积:

\[
R_{i \xrightarrow{} \cdot} = \operatorname{softmax}(K^T q^{(i)} \otimes v^{(i)}) \tag{6}
\]

其中 \(\otimes\) 是外积。接下来,为了从权重得到实际的关系角色叠加,我们与该层的角色矩阵做点积:

\[
RS_{i \xrightarrow{} \cdot} = R_{i \xrightarrow{} \cdot} \cdot ROLES^{t+1} \tag{7}
\]

*图3:角色变换器。我们展示索引为 \(i\) 的一个标记的处理过程。该块接收第 \(t\) 层中标记 \(i\) 的角色叠加向量 \(RS_i^t\),并输出该标记下一层的角色叠加向量 \(RS_i^{t+1}\)。符号说明:\(\times\) 是矩阵乘法,\(\otimes\) 是外积,\(\cdot\) 是点积,\(\_T\) 是转置。*

然而,我们不希望仅仅基于旧角色而形成的新角色就是最终表示。为了获得组合性,我们需要存储新选择的关系角色与现有角色的组合,以更明确地表明关系是发生在每个标记的表示之间:

\[
RS_i^{(t+1)} = \sum_{i'=1}^{n} \operatorname{BindSum}(RS_{i'}^t, RS_{i \xrightarrow{} i'}^t) \tag{8}
\]

其中 \(\operatorname{BindSum}\) 定义如下:

\[
\operatorname{BindSum}(A,B) = \frac{1}{\alpha}(A \odot B) + \frac{1}{\beta}A + \frac{1}{\beta}B \tag{9}
\]

我们不单独使用绑定操作,因为 \(A \odot B\) 与 \(B\) 完全不相干(除噪声外),但我们希望保持相似性,使得具有重叠角色的表示在共享任何角色时仍能保持一定相似性,而在共享角色组合时具有更大的相似性。超参数 \(\alpha\) 和 \(\beta\) 用于控制捆绑后的 HRR 向量幅值膨胀,否则该膨胀可能淹没新加入的角色向量的相对影响。然而,这确实会导致早期层次的影响以指数方式衰减,如果 \(\alpha\) 和 \(\beta\) 过大,这可能是一个大问题。我们通过前面提到的 \(Multi\) HRR 向量来解决这个问题,该向量在跨层次之间包含均衡加权的表示,因为……

相似文章