超越对错:评估大型语言模型中的二阶社会推理
摘要
本文提出了一种新颖的框架,用于评估大型语言模型中的二阶社会规范推理,发布了NormReact数据集,并揭示了当前LLMs在惩罚性社会制裁方面的预测高于人类判断。
arXiv:2609.05437v1 公告类型:新
摘要:此前的AI对齐工作主要集中在一阶社会规范上——教模型什么是社会可接受或不可接受的(例如,‘不要偷窃’)。然而,社会智能不仅依赖于规范识别,还依赖于预测谁将执行它以及如何执行(例如,公开羞辱甚至监禁)。这些二阶期望,称为元规范,支配着人们在社会规则被打破时的反应。我们引入了一个新颖的框架,用于评估大型语言模型(LLMs)中的元规范推理,沿两个维度:情感评估和行为反应,并提出了新的分类任务,即预测违规者的自我调节和观察者的他人调节。我们发布了一个多视角数据集NormReact,包含450个规范违规场景,手工标注了情感和行为反应,跨越违规者的性别和观察者的社会亲近度。当前的LLMs描绘了一个更严酷的社会世界:在六个模型中,它们在人类期望无行动的情况下过度预测负面制裁,并且随着社会距离的增加,与人类判断的对齐度下降。这些发现表明,在从冲突调解到政策模拟的规范敏感领域中,AI系统可能冒着产生社会监管扭曲图景的风险:这种图景过度代表了惩罚,而低估了现实世界中规范执行所体现的容忍、克制和关系调节。
查看缓存全文
缓存时间: 2026/09/10 08:33
# 超越对错:评估大型语言模型的二阶社会推理能力 来源:https://arxiv.org/html/2609.05437 金翼匡† 宾夕法尼亚尼亚大学 | 雷汉·贾马洛娃 宾夕法尼亚尼亚大学 | 安妮·楼 宾夕法尼亚尼亚大学 | 克里斯蒂娜·比基耶里 宾夕法尼亚尼亚大学 | 尼亚蒂·马尔霍特拉 世界银行 | 维克多·乌戈·奥罗斯科-奥尔韦拉 世界银行 | 安娜·玛丽亚·穆尼奥斯-布代特 世界银行 | 莱尔·H·昂格尔 宾夕法尼亚尼亚大学 | 沙拉特·C·贡图库 宾夕法尼亚尼亚大学 ###### 摘要 此前的AI对齐工作主要关注一阶社会规范——教导模型什么是社会可接受或不可接受的(例如,“不要偷窃”)。然而,社会智能不仅依赖于规范识别,还依赖于预测谁会执行规范以及如何执行(例如,公众羞辱甚至监禁)。这些被称为元规范的二阶预期,支配着人们在社会规则被打破时的反应。我们引入了一个新框架,从两个维度评估大型语言模型(LLMs)的元规范推理能力:情感评估与行为反应,并提出了新的分类任务,即预测违规者的自我调节和观察者的他人调节。我们发布了一个多视角数据集NormReact,包含450个规范违规场景,针对违规者性别和观察者社会亲近度,人工标注了情感与行为反应。当前的LLMs描绘了一个更严苛的社会图景:在六个模型中,它们在人类预期无作为的情境中过度预测负面制裁,并且随着社会距离增加,与人类判断的一致性下降。这些发现表明,在从冲突调解到政策模拟的规范敏感领域中,AI系统可能会呈现扭曲的社会调控图景:过度代表惩罚,而低估现实世界规范执行中常见的容忍、克制与关系调适。111代码、数据和附录可访问:https://github.com/sunnyraiphd/NormReact \*\*脚注文本:这些作者对本文贡献均等。 ## 1 引言 社会规范的遵守不仅取决于知道规范的存在,还取决于关于谁将执行规范、如何执行以及在什么条件下执行的共享预期系统(Axelrod, 1986;Bicchieri, 2005)。早期的AI对齐工作主要关注一阶社会规范,教导模型什么是社会可接受或不可接受的(例如,“不要偷窃”)(Forbes et al., 2020;Hendrycks et al., 2021;Yuan et al., 2024;Rai et al., 2025;Jiang et al., 2021;Ziems et al., 2022)。近期的研究开始关注社会感知对话与情感视角提取(Zhong et al., 2023;Vijjini et al., 2024;Havaldar et al., 2024)。然而,人类的社会智能不仅体现在规范识别上,还体现在对规范违反后果及其执行的预期上(Heatherton, 2011)。为驾驭复杂的社会环境,AI模型必须理解这些支配共享预期的二阶规范(即元规范),包括谁将进行制裁、如何执行以及在什么关系条件下执行。一个能够判断对错但无法建模这些二阶动态的AI系统,恰恰缺乏决定规范是持续、削弱还是被多元忽视的社会结构性理解。缺乏这种二阶理解,模型输出在心理健康支持、冲突解决和内容审核等敏感应用中可能会显得社会迟钝甚至有害。 参见图表说明图1:元规范推理评估框架。现有的社会规范基准缺乏二阶规范推理的核心特征:违规者和观察者在何时干预、如何反应,以及这些反应如何随关系情境变化。为解决这些不足,我们引入了一个评估框架,将元规范推理操作化为两个维度:(a)规范违反后的情感反应,以及(b)行为反应(图1)(Eriksson et al., 2021;Molho et al., 2020;Haidt, 2003)。情感维度捕捉人们在规范违反后的感受预期,行为维度捕捉规范执行者在实际会做什么(描述性规范)与规范执行者应该做什么(指令性规范)的预期。该框架还通过三级社会关系(强纽带、弱纽带和陌生人)变化规范执行者与违规者之间的社会关系,从而测试LLMs是否能根据关系情境调整其预测。我们将LLMs的预测与人类对日常规范违反场景(来自Reddit)的判断进行比较,这些场景的反应通常取决于竞争性义务和关系情境。我们做出三项贡献: - •一个用于评估LLMs二阶社会推理的框架,将元规范推理分解为自我调节(违规者情感)、他人调节(观察者情感)和规范执行(行为制裁)。 - •一个名为NormReact的基准数据集,包含450个规范违规场景,附带多视角人工标注,标注覆盖违规者性别和观察者社会距离。 - •证据表明,当前的LLMs构建了一个比人类所认可的更具惩罚性的社会生活模型:它们过度预测谴责与干预,尤其在社会距离增加时。 这些贡献共同为评估AI系统能否超越规范识别、走向支撑人类社会智能的关系校准二阶推理提供了基础。 ## 2 元规范评估框架 #### 情感 我们采用Haidt的道德情感框架来捕捉违规者与观察者的情感状态(Haidt, 2003)。对违规者而言,**羞耻**、**内疚**和**尴尬**源于社区所反对违规行为的自我负面评价信号。对观察者而言,**愤怒**、**蔑视**和**厌恶**主要在看到社会秩序或群体凝聚力受到威胁时产生,这些情感促使制裁或回避(Eriksson et al., 2017, 2021)。在本研究中,我们使用**骄傲**和**同情**而非原始量表中的**升华**和**感恩**,以贴合社会规范文献(Tracy and Robins, 2007;Goetz and Keltner, 2007)中的积极情感。当违规者将行为视为道德勇气的表达时,可能会产生骄傲;当观察者将行为解读为有原则或令人钦佩时,也可能产生骄傲。当观察者看到行为背后的困境或限制时,可能会产生同情;当违规者对受影响者感到关切时,也可能产生同情。重要的是,观察者和违规者可能体验相同的情感,但原因不同。 #### 行为 我们通过多选题衡量对规范违反的行为反应。类别包括正式与非正式制裁(Eriksson et al., 2017, 2021):(1)不作为,(2)散布流言,(3)口头对抗,(4)身体对抗,(5)告知权威,(6)保持距离(社会排斥),(7)赞扬,(8)庆祝(参见§LABEL:appendix:survey)。每个分类动作变量被编码为一组二元指示符(0 = 未选择,1 = 选择)。对每个场景,我们引出两种判断:**描述性元规范**(观察者**会**做什么),以及**指令性元规范**(观察者**应**做什么)。这一区分映射到社会规范理论中的经验预期与规范预期之别(Bicchieri, 2005):人们遵守规范不仅因为他们观察到他人遵守,还因为他们相信他人期望遵守并认为自己有权制裁偏差。描述性与指令性元规范之间的差距也提供了关于执行方面多元无知的诊断(Prentice and Miller, 1993)。 #### 社会距离 制裁的合法性在所有社会关系中并不均匀;相反,对抗或散布流言的权利取决于观察者在违规者社会网络中的位置(Granovetter, 1973)。为测试LLMs是否捕捉到这一关系维度,我们通过三个层级变化观察者与违规者之间的社会距离:(a)强纽带:家庭成员和亲密朋友;(b)弱纽带:同事、熟人和疏远的朋友;(c)陌生人。这映射到社会规范理论中的**参照网络**概念,即个人在决定是否以及如何执行规范时认为相关的他人集合(Bicchieri, 2016)。 #### 预测自我调节与他人调节 我们框架中的八种情感映射到规范遵守研究的一个基础区分:**自我调节**与**他人调节**之别(Tangney et al., 2007)。自我聚焦情感,即**羞耻**、**内疚**和**尴尬**,作为内部调节机制,反映内化规则:个人自身认为对的。他人聚焦情感,即**蔑视**、**厌恶**和**愤怒**,作为外部调节机制,驱动社会制裁(Crockett, 2017;Tybur et al., 2020;Molho et al., 2017)。这种自我-他人区分与社会规范文献中的一个基本洞见相呼应:规范遵守由内部和外部机制共同维持,它们的相对权重可诊断所涉规则的类型。当遵守主要由自我聚焦情感(内疚、羞耻)驱动时,这可能反映内化规则或个人规范信念:即个人自身认为对的,独立于社会预期。当遵守主要由他人聚焦情感和外部制裁驱动时,更可能反映技术意义上的社会规范:一种由参照网络内相互依存的预期和条件性偏好所维持的行为规则(Bicchieri, 2005)。 对于行为反应,我们将五种主动制裁(即散布流言、口头对抗、身体对抗、告知权威和保持距离)归为一类**制裁**,与**无制裁**(不作为、赞扬和庆祝)相对比。这捕捉了容忍违规与主动执行规范之间的根本区别。这些分组共同为LLMs评估产生三项二元分类任务: 1. 1. **自我调节(情感)**:AI模型能否预测规范违规者是否会体验自我聚焦情感,即促进自我纠正的内部制裁是否被激活? 2. 2. **他人调节(情感)**:AI模型能否预测观察者是否会对规范违反表达他人聚焦情感,即执行社区标准的外部制裁是否被触发? 3. 3. **规范执行(行为)**:AI模型能否预测观察者是否会主动制裁规范违反,即情境是否引发干预或容忍? 此评估特意采取保守策略。通过将八种情感归为两类调节机制,将八种行为归为二元分类,我们赋予模型最简单的分类任务——仅需区分自我调节与他人调节,而非辨别个体情感。这一区分对AI部署具有直接意义。用于心理健康支持的模型必须预期违规者的羞耻与内疚以做出共情回应;内容审核系统必须预测社区的愤怒与厌恶以评估执行可能性。在两种情况下,模型都必须区分给定情境激活了哪种调节路径。 ## 3 数据集、调查与参与者 #### 社会场景 我们从Social-Chem-101数据集(Forbes et al., 2020)中针对五种道德基础各抽取约90个社会情境(参见表LABEL:tab:mft\_agreement)。我们仅保留那些行为者与经验法则中目标角色匹配,且经验法则指示负面道德评价(例如,“不好”、“你不应该”、“粗鲁”)的条目。我们排除了假设性、非规范性和行为上未充分定义的样本。 **性别化社会场景**:针对每个场景,我们通过交换名字和性别化关系同时保留原始社会结构,创建了男性和女性版本(例如,“James穿着他朋友和兄弟的内衣”与“Patricia穿着她朋友和姐妹的内衣”)。为引入多样化的角色并保持真实性,我们使用了美国最常见的10个男性和女性名字(Forebears.io, 2025)。 #### 调查项目 调查项目包含简短的 vignette 式社会场景,描绘规范违反,这是社会科学中引出标准化判断的常用方法(Aguinis and Bradley, 2014)。例如,一个场景可能描述“一位同事将他人的工作归功于自己”。有关参与者说明和调查项目的详情,请参见§LABEL:appendix:survey。 #### 人类参与者 在后续分析中,我们纳入了来自Prolific的871名评分者(463名女性、397名男性、7名非二元性别、4名不愿透露,年龄:M (SD) = 45.3 (13.6) 岁,种族:604名白人、104名非裔美国人、73名亚裔、56名西班牙裔/拉丁裔、28名混血、5名其他种族、1名缺失),排除了38名未通过质量检查的评分者。每位评分者随机评估三个来自刺激列表的社会场景,确保每个场景至少由三名评分者评估。本研究经机构审查委员会审查批准(IRB协议# 858986),在调查前获得了同意。 参见图表说明图2:不同社会距离下对规范违反的情感与行为反应。 #### 模型选择 我们评估了一系列多样化的最先进模型,包括闭源模型(GPT-5.2(高推理)、Gemini-3-Pro和Claude-4.5-Opus)和开源模型(GPT-OSS-20B、Llama-4-Scout-17B和Gemma-3-12B)(参见表LABEL:tab:llm\_summary)。在我们的实验时,这些模型是各自系列中的最新发布,且
相似文章
立场:人工智能道德推理评估仍只看到一半图景
本文批判了现有人工智能道德推理评估过于关注道德价值而忽视道德规范,并提出一个研究议程,旨在开发标准化方法和数据集,以评估大型语言模型中的规范性推理。
超越准确率:大型语言模型统计推理的多维评估
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。
从被动代理人到战略谈判者:使用 SocialRL 强化小型语言模型中的社会推理能力
本文介绍了 SocialRL,一种强化学习方法,用于增强小型语言模型中的社会推理能力,使其能够有效谈判,并在多种交互领域中匹配或超越 GPT-5 等大型模型的表现。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。