REGARD:大型语言模型中的区域情感差异
摘要
本文介绍REGARD,一项使用Valence-Arousal-Dominance画像法测量LLM对后苏联实体情感框架差异的研究,揭示模型按情感强度和通用回答率聚类,而非按来源或规模聚类。
arXiv:2607.20722v1 公告类型:新
摘要:在不同语言和区域生态系统中训练和对齐的大型语言模型可能以不同方式构建同一政治、文化和地缘政治实体。此类差异通常通过情感、好感度或立场来评估,将模型态度简化为单一的正负轴。我们引入REGARD,一项利用目标导向的Valence-Arousal-Dominance画像法探究LLM对后苏联实体情感框架差异驱动因素的研究。我们查询了19个模型对500个特定区域目标的响应,使用两个独立的LLM评判器——GPT-4o-mini和Qwen3.6-35B-A3B——对响应进行评分,并在一个包含300个条目的手工标注子集上验证测量结果。对所有19个模型的情感与响应行为画像进行事后Ward-linkage聚类,产生了三个行为集群,这些集群跨越了模型的来源、系列和参数数量。通用回答率与较低的唤醒度(r=-0.81)及集群归属密切相关:那些用模板化响应回避评估性提示的模型,无论其来源如何,都会在低唤醒度处聚集在一起。这些发现表明,VAD画像法捕捉到了情感强度,这是一个在很大程度上被传统基于情感的评价所忽略的情感框架维度。
查看缓存全文
缓存时间: 2026/07/24 05:17
# 1 引言
来源:https://arxiv.org/html/2607.20722
**REGARD:大型语言模型中的区域情感差异**
Andrei Chetvergov¹,², Alexander Evseev¹,², Mikhail Solovev¹,², Timofei Sivoraksha¹,²
Stepan Ukolov¹,², Valeriia Kuschenko², Maria Chistyakova², Sergey Bolovtsov¹,²
¹俄罗斯科学院伊万尼科夫系统编程研究所,莫斯科,俄罗斯
²俄罗斯总统国民经济与公共管理学院,莫斯科,俄罗斯
\{chetvergov\-as,aevseev\-23\-01,sivoraksha\-ta\}@ranepa\.ru
\{ukolov\-sd,mchistyakova\-25,bolovtsov\-sv\}@ranepa\.ru
\{msolovev\-24,vkuschenko\-22\}@edu\.ranepa\.ru
###### 摘要
在不同语言和区域生态系统中训练并对齐的大语言模型,对相同的政治、文化及地缘政治实体可能以不同方式进行框架描述。此类差异常通过情感、好感度或立场来评估,将模型态度简化为单一的正-负轴。我们提出 REGARD 研究,探究哪些因素驱动大语言模型在后苏联实体上的情感框架差异,采用目标导向的效价-唤醒-支配(VAD)剖面分析。我们对 500 个独联体特定目标查询了 19 个模型,使用两个独立的 LLM 评估器(GPT-4o-mini 和 Qwen3.6-35B-A3B)对回复评分,并在包含 300 个人工标注项目的子集上进行验证。对所有 19 个模型按情感和回复行为剖面进行事后 Ward 连接聚类,得到三个行为聚类,这些聚类跨越模型来源、系列和参数规模。通用回答率与较低的唤醒度强相关(r=−0.81),并与聚类位置相关:那些用模板化回复回避评估性提示的模型,无论来源如何,都聚在低唤醒度组。这些发现表明,VAD 剖面揭示了一个情感框架的维度——情感强度——这是传统基于情感的评价所无法看到的。
关键词:大型语言模型,情感框架,效价-唤醒-支配,俄语自然语言处理,模型评估,区域性模型比较,后苏联空间
当要求语言模型描述一个历史人物或政治事件时,其回复并非中立的。偏见基准和好感度研究一致表明,模型输出带有隐含的评估立场——这些立场受训练数据、RLHF 目标以及构建模型的组织的文化背景所塑造[1 (https://arxiv.org/html/2607.20722#bib.bib1),15 (https://arxiv.org/html/2607.20722#bib.bib15),12 (https://arxiv.org/html/2607.20722#bib.bib12)]。在不同国家开发的模型已被发现对政治行为者和文化对象的表征存在分歧,反映了其创造者的意识形态环境[19 (https://arxiv.org/html/2607.20722#bib.bib19),17 (https://arxiv.org/html/2607.20722#bib.bib17)]。与此同时,大多数关于大语言模型意见表征的研究评估的是通用或英语中心的话题集[14 (https://arxiv.org/html/2607.20722#bib.bib14),3 (https://arxiv.org/html/2607.20722#bib.bib3)],而未探讨国内开发的模型对其*自身区域*特有的实体的框架描述是否与非俄罗斯模型不同。
另一个局限性在于测量方法。标准情感分析将情感简化为单一的极性得分——正面、负面或中性[6 (https://arxiv.org/html/2607.20722#bib.bib6),2 (https://arxiv.org/html/2607.20722#bib.bib2)]。这虽然实用,但过于贫乏:一个冷静的赞同和一个热情的赞同都是正面的,但它们承载的沟通分量不同;一个历史事件可以被描述为一个悲剧性但边缘的插曲,也可以被描述为一个强大的历史转折点,这些框架的分歧不在于效价,而在于情感强度和感知规模。来自情感心理学的效价-唤醒-支配(VAD)框架[13 (https://arxiv.org/html/2607.20722#bib.bib13),16 (https://arxiv.org/html/2607.20722#bib.bib16),9 (https://arxiv.org/html/2607.20722#bib.bib9)]将情感分解为三个独立维度——描述正面或负面的程度(效价)、情感强度(唤醒度)、以及实体展现的强弱(支配度)——并为测量自由文本 LLM 输出中的情感框架提供了一种天然工具,而仅凭极性无法区分这些维度。
我们在 REGARD 研究中将这两条线索结合起来,探讨哪些因素驱动大语言模型在后苏联实体上的情感框架差异。我们询问 19 个模型 500 个独联体特定目标,使用两个独立的 VAD 评估器对回复评分,并探究:最能解释我们观察到的唤醒度和支配度变化的因素是什么——模型来源、模型系列,还是模型层面的回复行为?
#### 研究问题。
RQ1: 不同模型在 VAD 维度上对独联体相关实体的框架描述是否存在系统性差异?在哪些轴上存在差异?
RQ2: 当根据情感和回复行为剖面(不借助来源标签)对模型进行事后聚类时,这些差异揭示了怎样的结构?
RQ3: 由此产生的聚类与模型来源、架构以及通用回答行为有何关系?
图1 (https://arxiv.org/html/2607.20722#S1.F1) 总结了完整流程,从目标库构建到生成、VAD 评分、人工验证以及模型层面分析。
参照图标题图 1: REGARD 研究概览。本次发布包含 500 个目标、19 个生成器模型和三种俄语提示变体,产生 28,500 条回复和 57,000 个回复-评估器对。人工验证包括 15 名标注员对 300 个项目进行的 900 次评分。
## 2 相关工作
标准情感分析将情感简化为单一的极性维度。基于词典和语料库的情感计算在连续的效价-唤醒-支配轴上对文本进行评分[8 (https://arxiv.org/html/2607.20722#bib.bib8),9 (https://arxiv.org/html/2607.20722#bib.bib9),16 (https://arxiv.org/html/2607.20722#bib.bib16)]。另一条并行的工作线是直接从大语言模型中引出意见,并将得到的分布与人类调查基线进行比较[14 (https://arxiv.org/html/2607.20722#bib.bib14),3 (https://arxiv.org/html/2607.20722#bib.bib3)],发现系统性分歧对提示语言和框架敏感。大语言模型编码了可追溯至预训练语料构成的政治和文化倾向[4 (https://arxiv.org/html/2607.20722#bib.bib4),1 (https://arxiv.org/html/2607.20722#bib.bib1)],而基于英语中心数据训练的模型歪曲了非西方文化实践[11 (https://arxiv.org/html/2607.20722#bib.bib11),10 (https://arxiv.org/html/2607.20722#bib.bib10)]。中美大语言模型的地缘政治比较揭示了同一政治实体的不同表征[19 (https://arxiv.org/html/2607.20722#bib.bib19),17 (https://arxiv.org/html/2607.20722#bib.bib17)]。我们的工作与以往研究的不同之处在于:针对区域特定的实体库,使用 VAD 而非极性,并使用大语言模型评估器而非调查工具或分类器探针。关键在于,标量情感无法区分极性相同但强度不同的文本:一个模型将历史悲剧描述为安静的悲伤与震惊的灾难会得到相同的情感得分——而 VAD 直接捕获了这种区别,这对于媒体偏见审计和情感敏感内容检索至关重要。
## 3 数据
我们构建了 CIS-Affective-500,这是一个包含 500 个与更广泛的独联体和后苏联地区相关的实体的集合,涵盖六个类别:人物、组织、事件、文化符号与地点、社会群体和国家。12 个研究国家包括:亚美尼亚、阿塞拜疆、白俄罗斯、格鲁吉亚、哈萨克斯坦、吉尔吉斯斯坦、摩尔多瓦、俄罗斯、塔吉克斯坦、土库曼斯坦、乌克兰和乌兹别克斯坦。表1 (https://arxiv.org/html/2607.20722#S3.T1) 给出了各类别分布。国家覆盖近乎均匀(每个国家 39–45 个实体),在构建时在每个类别内强制设置,而非事后调整。
表 1: CIS-Affective-500 按类别分布。所有实体均锚定到 Wikidata QID,并来自两个主要来源。大多数(79%,395 个实体)来自 Wikidata:涵盖所有 12 个研究国家的人物、组织、历史事件和文化对象,候选者按 Wikidata 显著性(网站链接数)排序,并经人工审核而非自动收录。剩下的 18.6%(93 个实体)来自联合国教科文组织非物质文化遗产和世界遗产名录,包括该地区的史诗、口头传统、仪式习俗、传统美食和建筑古迹。12 个研究国家形成一个固定的内置种子。整个库涵盖:人物(150 个实体,30%);文化符号或地点(110 个,22%);组织(80 个,16%);社会群体(78 个,15.6%);事件(70 个,14%);以及 12 个研究国家本身(12 个,2.4%)。
国家覆盖在全部 12 个研究国家中近乎均匀(每个国家 39–45 个实体)。
#### 边界情况。
对于 16 个实体(3.2%),国家归属并不明确——包括跨区域历史人物、多国公众人物、名称歧义实体以及具有跨国意义的广泛历史事件。每个实体均保留,并附有明确的范围说明,而非悄然剔除;其余 484 个实体无异议地通过验证。
#### 标注。
每个实体都标注了一个简短的、自然的俄语标签,用于直接插入生成提示,明确区别于其正式的 Wikidata 标签。实体通过 Wikidata QID 去重;所有 500 个标识符通过编程验证唯一。
## 4 生成与评分
### 4.1 模型
我们评估了 19 个生成器模型,涵盖不同的来源、系列和参数规模(7B–27B):YandexGPT、GigaChat、T-pro-it-2.1、AVIBE、GLM-4.7、Gemma-4-26B、Qwen2.5-14B、Ministral-3-14B、Granite-4.1、Llama-3-8B、Qwen3.6-27B、Ministral-8B、Mistral-Nemo、Phi-3-Medium、Qwen2.5-Coder-14B、SOLAR-10.7B、Mistral-7B、Qwen2.5-7B、Granite3.3-8B。未预先分配来源标签;聚类成员身份根据 VAD 剖面事后确定。所有模型在温度 0.7、无系统提示、最大 512 个输出令牌的条件下查询。通过构造避免直接自我评估:评估器来自一个不相交的池。
### 4.2 提示
所有模型均使用俄语进行提示。主要表述要求用 4-5 句话给出明确的评估立场,无需数字评分。为了测试对措辞的敏感性,每个模型-目标对还使用中性描述性提示和评估性改写进行评价。图2 (https://arxiv.org/html/2607.20722#S4.F2) 复制了所有三个提示及其英文翻译。主要结果使用评估立场提示;各表述之间的鲁棒性在第9节 (https://arxiv.org/html/2607.20722#S9) 中讨论。
参照图标题图 2: REGARD 中使用的俄语生成提示,附英文翻译。三个相同的表述应用于每个模型-目标对。
### 4.3 评估合约与 VAD 尺度
我们引入了*评估合约*的概念:一个固定的、带有版本的提示规范,定义了每个 VAD 轴衡量的内容、锚点如何映射到真实世界的框架示例,以及评估器必须随数字分数一起发出的质量标志。将合约形式化为一个可复用的工件——而不是将评分指令临时嵌入实验代码——使得测量协议可重现且可审计,独立于用于运行它的模型。
生成由两个独立的评估模型 Qwen3.6-35B-A3B 和 GPT-4o-mini 评分,这两个模型均未出现在上述生成器列表中——这避免了直接的自我评估,这是 LLM-as-judge 设计中已知的方法论弱点,即模型对其自身生成内容进行评分可能夸大一致性或掩盖自身输出中的偏见。这两个评估器来自不同的模型系列(开放权重 vLLM 服务 vs. 基于 API),因此它们的共享输出不能追溯到单个供应商的先验。先前关于基于大语言模型的 EmoBank VAD 评分工作发现,API 类模型与人类 VAD 评分的 Pearson 相关性高于开源模型(效价 r=0.67),并且效价是跨模型系列最可靠捕捉的维度[7 (https://arxiv.org/html/2607.20722#bib.bib7)]——这与我们在第6节 (https://arxiv.org/html/2607.20722#S6) 中的跨评估器一致性结果一致。我们使用两个评估器而非一个,因为[7 (https://arxiv.org/html/2607.20722#bib.bib7)] 表明,不同的零样本模型系列在情感维度上表现出性质不同的失败模式(API 模型过度预测负面情绪;开源模型默认保守的中性预测),使得单一评估器分数在不同方向上存在系统性偏差;平均来自不同系列的两个评估器可降低这种方向性风险。
所有三个 VAD 轴都在统一的 [0,1] 尺度上评分,而不是将效价视为双极 [-1,1] 而唤醒度和支配度保持单极 [0,1]:效价 0.5 表示中性框架,0 表示最大负面,1 表示最大正面;唤醒度和支配度保留其标准单极解释(冷静 vs. 情感强烈;无力/被动 vs. 有能动性/有影响力)。这一选择使三个轴在后续距离计算(第5节 (https://arxiv.org/html/2607.20722#S5))中处于共同尺度。表2 (https://arxiv.org/html/2607.20722#S4.T2) 明确了操作锚点。
表 2: 两个 VAD 评估器共享的操作锚点。中间值在 [0,1] 上连续允许。#### 两个评估器的使用。
主要剖面、聚类和类别级结果使用 Qwen3.6-35B-A3B 分数,并应用了 `target_coverage≥0.5` 过滤,如相应图和表标题所述。GPT-4o-mini 在相同合约下对每次生成进行评分,并在第6节 (https://arxiv.org/html/2607.20722#S6) 中提供模型排序和组模式的独立复制。除非另有说明,人工验证相关性和定性评估器失败分析使用两个评估器的平均值。
## 5 结果:跨模型的 VAD 剖面
图3 (https://arxiv.org/html/2607.20722#S5.F3) 展示了所有 19 个模型的平均 VAD 分数,按唤醒度排序。唤醒度是变化的主要轴:范围从 0.34(YandexGPT)到 0.58(GLM-4.7),在 [0,1] 尺度上相差 0.24 个单位。相比之下,效价被压缩在一个狭窄的带内(0.61–0.76),且跨聚类无系统性排序。支配度与唤醒度紧密相关:表达性聚类(C3)的平均支配度为 0.69,中等聚类(C2)为 0.67,回避性聚类(C1)为 0.65。
参照图标题图 3: 所有 19 个生成器模型的平均 VAD 分数(评估立场提示,Qwen3.6-35B-A3B 评估器,500 个目标),按唤醒度排序。颜色表示聚类成员(蓝色 = C1 回避型,绿色 = C2 中等型,品红色 = C3 表达型)。唤醒度和支配度在模型间差异显著;效价在所有聚类中保持狭窄带。
表3 (https://arxiv.org/html/2607.20722#S5.T3) 报告了涵盖所有三个聚类的代表性模型子集的每个模型的 VAD 均值和质量标志率。YandexGPT 的唤醒度最低(0.34)相似文章
负面先于正面:大型语言模型中的不对称效价处理
本文通过机理可解释性研究大型语言模型如何处理情感效价。通过在三个开源LLMs上使用激活修补和引导,作者发现负面效价定位于早期层,而正面效价在中后期层达到峰值,并通过主题控制翻转测试验证了这一点。
表达社会情感:大语言模型与人类文化情感规范的错位
本研究论文考察了大语言模型表达社会情感的方式与人类文化规范的匹配度,发现两者存在系统性错位。与人类回应相比,大语言模型在不同文化身份(欧美裔美国人与拉美裔美国人)下表现出的参与型与抽离型情感表达模式不一致。
模型在哪里找到快乐?开源LLM中的情感向量
本文复现了开源权重大语言模型Apertus-8B和Gemma-4-E4B中'情感向量'的发现,表明价态几何结构在不同模型间可恢复,但层间出现时机存在差异。研究还发现唤醒编码对用于提取的故事语料库敏感。
一些大型语言模型表现出一致的风险态度
本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。
现代大语言模型与人类脑电图中共有的效价轴:饱和规律
本文发现了现代大语言模型与人类脑电图信号之间共有的效价轴(V-axis),表明LLM内部表示中的一个单一方向与对情感刺激的神经反应一致。它还识别了饱和规律,解释了为何基于LLM的监督无法改善脑电图解码,以及如何利用残差多样性提升性能。