社会规范一致性的自然主义测量

arXiv cs.CL 论文

摘要

本文提出了一种通过解决方案匹配在自然、自由形式的设置中测量社会规范一致性的框架,介绍了包含3000个丹麦语社会困境的数据集,并评估了大语言模型与人类回答之间的一致性。

arXiv:2605.23420v1 公告类型:新 摘要:社会规范反映了对可接受行为的共同期望。测量社会规范一致性仍然具有挑战性,现有方法通常依赖于人为的封闭式评估,例如多项选择问卷或测量与预定义陈述的一致性。在本工作的背景下,社会规范一致性指的是针对社会问题或困境测量解决方案之间的一致性。我们提出了一种通过解决方案匹配在自然、自由形式的设置中测量社会规范一致性的框架。该框架使我们能够测量任意两个困境回应之间的一致性,例如大语言模型对人类、大语言模型之间或人类之间。我们引入了两个指标:陈述一致性和显式一致性准确率,并构建了一个包含3000个非平凡丹麦语社会困境的数据集。所有困境都分配了由三位小组成员得出的参考解决方案,他们作为文化背景下的评判者。我们在类似于自然用户模型对话的交互设置中评估了几个大语言模型和人类回答的一致性。我们的结果表明,所提出的指标产生了一致的模型排名,并揭示了不同类型困境之间的一致性的变化,其中在邻里冲突和共同居住情况等主题上观察到更高的一致性。总体而言,我们的工作引入了一个数据集和评估框架,用于研究自然开放式对话中基于文化背景的社会推理。
查看原文
查看缓存全文

缓存时间: 2026/05/25 09:02

# 社会规范对齐的自然主义度量

来源:https://arxiv.org/html/2605.23420

Yevhen Kostiuk∗,Kenneth Enevoldsen∗,Peter Bjerregaard Vahlstrup,Márton Kardos,Kristoffer Nielbo,奥胡斯大学  
通讯地址:\{ykost , kenneth\.enevoldsen\}@cas\.au\.dk  

###### 摘要  
00footnotetext:∗同等贡献。社会规范反映了对可接受行为的共同期望。衡量社会规范对齐仍然具有挑战性,现有方法通常依赖于人为的封闭式评估,例如多项选择问卷或衡量与预定义陈述的一致性。在本工作的语境中,社会规范对齐指的是衡量各解决方案在应对社会问题或困境时的一致程度。我们提出一个框架,通过方案匹配在自然主义、自由格式的设置中衡量社会规范对齐。该框架使我们能够衡量任意两个困境响应之间的一致性,例如LLM对人类、LLM对LLM或人类对人类。我们引入两个度量:陈述一致准确率(SAA)和明确一致准确率(EAA),并构建了一个包含3000个非平凡丹麦语社会困境的数据集。所有困境都分配了由三位小组成员(作为文化背景下的评判者)得出的参考解决方案。我们在类似自然用户-模型对话的交互设置中评估了几个LLM和人类响应的一致性。我们的结果表明,所提出的度量产生了一致的模型排名,并揭示了不同类型困境之间的一致程度差异,在诸如邻里冲突和共享生活情境等话题上观察到更高的一致性。总体而言,我们的工作引入了一个数据集和评估框架,用于研究自然主义开放式对话中的文化背景社会推理。

自然主义的社会规范对齐度量  
Yevhen Kostiuk∗,Kenneth Enevoldsen∗,Peter Bjerregaard Vahlstrup,Márton Kardos,Kristoffer Nielbo,奥胡斯大学  
通讯地址:\{ykost , kenneth\.enevoldsen\}@cas\.au\.dk  

## 1 引言  
社会规范决定了人们在社会中如何沟通、行为和互动。违反社会规范可能导致误解、冲突、排斥等后果。这些规范是特定社会的:在一个文化群体中可接受的行为,在另一个群体中可能被视为完全不同。例如,从美国移居丹麦的人可能会发现,在美国正常的公共交通上的闲聊在丹麦通常是被避免的,除非你的火车晚点了——那时闲聊就完全没问题,即使聊的是不相关的话题。这表明社会规范不仅仅是文化或事实知识,而是高度情境化的,取决于具体情境。

参见图1:所提方法的视觉概览。

衡量社会规范对齐意味着评估个人信念、态度或行为与特定社会群体或社会公认期望或规则的匹配程度。现有方法依赖于封闭式设置,例如多项选择问卷(Yuan等人,2024 [https://arxiv.org/html/2605.23420#bib.bib40])、对预定义陈述的同意度评分(Abrams等人,2026 [https://arxiv.org/html/2605.23420#bib.bib39];Tao等人,2024 [https://arxiv.org/html/2605.23420#bib.bib38])以及分类评估(Forbes等人,2020 [https://arxiv.org/html/2605.23420#bib.bib41];Hadar-Shoval等人,2024 [https://arxiv.org/html/2605.23420#bib.bib37])。这些方法受限于其形式。通过固定的预定义响应集来衡量对齐无法充分捕捉社会规范的复杂性和细微差别。例如,多项选择任务中的预定义答案可能不正确或遗漏影响正确答案的相关条件。多项选择问卷无法捕捉自然的自由形式解空间。更具代表性的方式是从自由形式的回答中提取提出的解决方案,而不施加任何人为限制。这更具代表性,因为自由形式响应允许人们表达其推理、条件和解释,不受预定义选项的限制,这更好地反映了社会规范在现实世界中运作的方式。

在本文中,我们提出了一种新颖的方法,通过方案匹配在自然主义对话中衡量社会规范对齐,并为此任务建立了一个新颖的数据集。我们的方法能够衡量任意代理(人类、社会群体或人工智能代理)之间的对齐,而不限制响应格式,使交互保持自然。我们引入了两个度量:陈述一致准确率(SAA)和明确一致准确率(EAA)。我们的数据集基于丹麦广播公司(DR)的热门播客“Sara og Monopolet”构建,该播客在社会中被广泛接受,这体现在其播出时间、评分(截至撰写本文时,播客在Rephonic上获得4.4/5星,5,900条评分;在Apple播客上获得4.4/5星,5,600条评论)以及自2003年开播的事实。在播客中,嘉宾收到困境并讨论可能的解决方案。该数据集包含来自播客的3,023个高度详细的社会困境及其小组解决方案。播客和数据集均为丹麦语。得益于多嘉宾形式,我们能够得出反映广泛且多样化共识而非个人意见的响应。该播客的持久受欢迎程度表明它反映了丹麦的社会规范,突出了公众认可的可接受建议边界。

我们将框架应用于以下模型:gpt-5(Singh等人,2025 [https://arxiv.org/html/2605.23420#bib.bib6])、gemini-3-flash-preview(Google DeepMind,2026 [https://arxiv.org/html/2605.23420#bib.bib12])、odin-large(Ordbogen AI,2026 [https://arxiv.org/html/2605.23420#bib.bib11])由丹麦提供商Ordbogen.ai提供、mistral-3-large-2512(MistralAI,2025b [https://arxiv.org/html/2605.23420#bib.bib7])、gemma3-27b(Kamat等人,2025 [https://arxiv.org/html/2605.23420#bib.bib5])以及mistral-3.2-small-24b(MistralAI,2025a [https://arxiv.org/html/2605.23420#bib.bib4])。我们的结果表明,mistral-3.2-small-24b在小组解决方案上显示出比所有其他模型更高的一致性。我们的分析表明,所有模型在某些主题上比其他主题对齐得更好。

## 2 相关工作  
在分析社会规范对齐时,许多工作聚焦于Reddit(Sachdeva和van Nuenen,2025 [https://arxiv.org/html/2605.23420#bib.bib30];Chandrasekharan等人,2018 [https://arxiv.org/html/2605.23420#bib.bib29];Sachdeva和van Nuenen,2025 [https://arxiv.org/html/2605.23420#bib.bib30])。Reddit提供了庞大且易于获取的语料库,但用户的文化背景未知,且论坛通常由美国用户主导。非美国和非英语论坛虽然存在,但很少如此活跃且具有代表性。例如,Yudkin等人(2025 [https://arxiv.org/html/2605.23420#bib.bib33])分析了“Am I the Asshole? (AITA)”子版块的讨论,并得出结论认为它大致符合美国文化价值观。

许多社会规范对齐数据集是严格结构化的,例如多项选择问题(MCQ)或二元分类。Forbes等人(2020 [https://arxiv.org/html/2605.23420#bib.bib41])引入了一个包含292k条标注语句的数据集,描述北美英语群体的日常情境。每条语句都手动标注了行为可接受性及其他类别。Hendrycks等人(2020 [https://arxiv.org/html/2605.23420#bib.bib26])提出了ETHICS基准:关于社会可接受性的二元标注语句。Yuan等人(2024 [https://arxiv.org/html/2605.23420#bib.bib40])引入了一个数据集,包含超过12k道基于美国K-12课程的基本社会规范多项选择题。Abrams等人(2026 [https://arxiv.org/html/2605.23420#bib.bib39])提出了SNIC基准,评估模型是否正确应用日常规范。虽然此类数据集基于人类反馈,但与我们的语料库中呈现的现实世界困境相比,它们通常缺乏上下文深度和复杂性。

现代对齐评估方法依赖于LLM-as-a-judge框架。例如,Sachdeva和van Nuenen(2025 [https://arxiv.org/html/2605.23420#bib.bib30])使用LLM评估Reddit评论中关于道德困境表达的立场。Vo和Koyejo(2025 [https://arxiv.org/html/2605.23420#bib.bib31])提出了使用5个定性维度评估模型响应的方法。我们的方法利用基于LLM的评估来匹配响应的解空间。Imajo等人(2025 [https://arxiv.org/html/2605.23420#bib.bib32])提出了一种基于n-gram统计和规则匹配的替代评估方法。此类方法倾向于捕捉整体语义和句法相似性,而非复杂道德场景中涉及的细微推理(Kostiuk等人,2025 [https://arxiv.org/html/2605.23420#bib.bib25])。Emelin等人(2021 [https://arxiv.org/html/2605.23420#bib.bib36])引入了Moral Stories数据集,在美国文化背景下评估社会推理。每个条目包含一个社会规范、一个情境、一个意图、两个可能的行动及其相应后果。一个行动符合规范,另一个违反规范,任务是根据道德可接受性对行动进行分类。可能行动的范围仅限于两个替代方案。相比之下,我们的数据集试图为每个困境捕获更丰富的潜在解决方案集,并利用对齐,且不需要手动标注。

最后,最近的研究开始从社会规范的角度探索LLM代理的评估。Liu等人(2024 [https://arxiv.org/html/2605.23420#bib.bib35])引入了CASA,一个用于评估LLM网页代理中因果论证充分性并评估其文化和社会意识的零样本框架。类似地,Reza(2026 [https://arxiv.org/html/2605.23420#bib.bib34])提出了一个多代理辩论框架,其中LLM代理采用不同角色并就争议性话题进行辩论。

## 3 自然主义对齐评估框架  
在本节中,我们概述所提出的对齐框架。该框架旨在评估任意两个代理(人类、社会群体或人工智能代理)对社会困境响应的社会规范对齐程度。社会困境是自由形式的文本,包含情境描述和寻求建议的呼吁。下面我们提供一个简短的翻译示例。更多示例及其翻译见附录E(https://arxiv.org/html/2605.23420#A5)。算法示意如图2(https://arxiv.org/html/2605.23420#S3.F2)所示。该框架设计为多步骤系统。我们考虑了单一的LLM-as-a-judge方法,但多项工作(Haldar和Hockenmaier,2025 [https://arxiv.org/html/2605.23420#bib.bib10];Chehbouni等人,2025 [https://arxiv.org/html/2605.23420#bib.bib8]等)表明LLM在数值评估以及处理长序列详细上下文时存在困难。所提出的多步骤方法促进了可解释性、模块化和灵活性,这些都不是LLM-as-a-judge的强项。它还允许我们逐步评估过程(见以下各节)。

### 翻译示例  
当我遇到Finn时,我仍与前男友保持联系,因为我们有房子要卖,而且我的孩子们与父亲关系良好。Finn最初询问了这种联系,这让我重新考虑并切断了一些关系,但我保留了与孩子父亲的联系。几个月后,我听说Pia——Finn在我之前一年的女朋友;他还借给她一笔公寓押金,所以他们仍有联系。对我来说,与前任保持联系并不罕见,但我从未被告知Finn何时见Pia——只有在我问起时才知道。例如,他说他去散步了,但当我问是否和他母亲一起去时,他回答说不是,是和Pia一起,她发短信问他是否想一起去。我与Finn对质过,他说他们之间什么都没有。我不想要求他不要见她,但我觉得这被隐瞒了,这让我很纠结,胡思乱想。  
我该怎么办?

参见图2:方法概述。

### 3.1 方法论  
考虑候选代理和参考代理,\(A_{cand}\) 和 \(A_{ref}\)。我们的目标是基于他们从社会困境响应中提取的解决方案,评估 \(A_{cand}\) 相对于 \(A_{ref}\) 的社会对齐程度。我们基于Kostiuk等人(2025 [https://arxiv.org/html/2605.23420#bib.bib25])引入的“解决方案”定义和组件匹配规则(CMRs),并对其进行改编和扩展以适应社会规范对齐的语境。解决方案 \(s\) 是面临社会困境的人可能采取的建议行动(或一组行动)。我们改编了CMR来确定两个解决方案是否语义等价:解决方案 \(s_i\) 和 \(s_j\) 是匹配的,如果它们 (i) 包含相同的行动顺序,(ii) 共享相同的行动语义,(iii) 依赖于相同的条件,以及 (iv) 指代相同的实体或角色。解决方案可以是:建议的(\(s^+\),代理认可)或不建议的(\(s^-\),代理劝阻)。我们将此称为解决方案的立场。我们的方法包括两个步骤:**解决方案提取**和**解决方案匹配**。给定 \(A_{ref}\) 和 \(A_{cand}\) 对每个困境的响应,我们提取解决方案及其立场,通过CMR匹配它们,并计算对齐度量。两个步骤均由人工标注员手动验证;详情见小节A.3(https://arxiv.org/html/2605.23420#A1.SS3)和小节A.4(https://arxiv.org/html/2605.23420#A1.SS4)。

#### 解决方案提取  
对于每个困境 \(d\) 和提供的响应 \(r\),我们提取一组建议的(\(S_r^+\))和不建议的(\(S_r^-\))解决方案:
\[
(S_r^+, S_r^-) = \text{Extract}(d, r) \qquad (1)
\]
我们将所有响应中某个困境的建议和不建议解决方案的集合定义为每个响应集合的并集:\(S^\pm = \bigcup_r S_r^\pm\)。为了比较,我们跨立场对建议进行归一化,并单独存储立场。否定建议被转换为肯定行动形式并标记为不建议立场(例如,“不要买这个苹果”变为“买这个苹果”,立场为不建议)。解决方案使用gpt-oss-120b(OpenAI,2025 [https://arxiv.org/html/2605.23420#bib.bib23])提取,并配有任务定义、示例和结构化输出约束。使用同一模型的后处理步骤通过去重、过滤讽刺或不可操作建议、纠正立场不一致以及否定归一化来确保质量。

#### 解决方案匹配  
解决方案匹配步骤包括使用CMR匹配对困境 \(d\) 的等价响应。对于每个响应 \(r\),以及每对 \((s_i^{\sigma_i}, s_j^{\sigma_j})\),其中 \(s_i \in S_{cand,r}^\pm\) 且 \(s_j \in S_{ref,r}^\pm\),我们判断它们是否匹配。匹配的解决方案被认为是等价的。然后我们计算一致性度量:陈述一致准确率(SAA)和明确一致准确率(EAA)。SAA衡量候选代理提议的解决方案与参考代理提议的解决方案匹配的比例。EAA衡量候选代理明确建议的解决方案与参考代理明确建议的解决方案匹配的比例。具体定义见原文。我们使用基于LLM的匹配器,由同一个gpt-oss-120b模型驱动,并带有提示工程和一致性约束。匹配结果经过人工验证以确保可靠性。

相似文章

NormAct:具身规划中隐藏社会规范遵守的基准

arXiv cs.AI

NormAct是一个基准,用于评估具身规划代理在隐藏社会规范遵守方面的表现,结果显示最先进的多模态大语言模型(MLLMs)在目标达成率为67.3%时,规范遵守率仅为26.4%,并提出了NormPerceptor,将任务成功率从24.2%提升至46.7%。

表达社会情感:大语言模型与人类文化情感规范的错位

arXiv cs.CL

本研究论文考察了大语言模型表达社会情感的方式与人类文化规范的匹配度,发现两者存在系统性错位。与人类回应相比,大语言模型在不同文化身份(欧美裔美国人与拉美裔美国人)下表现出的参与型与抽离型情感表达模式不一致。

学习社会规范增强动态人机协调中的兼容性

arXiv cs.AI

本文研究了AI代理如何从人类行为中学习显式社会规范,以改善动态交互中的协调,并以人-车场景作为测试平台。所提出的基于规范的大语言模型在性能上显著超越基线策略及人类-人类交互。

涌现对齐

arXiv cs.AI

本文介绍了涌现对齐(Emergent Alignment)这一自监督方法,该方法为大型语言模型(LLMs)赋予一个“良心”步骤,用于审查自身输出,并利用直接偏好优化(DPO)引导模型远离非伦理行为,从而实现在无需外部评判者的情况下进行在线对齐。