LoSoNA:群体对话中局部社会规范适应的基准

arXiv cs.CL 论文

摘要

LoSoNA 是一个用于评估大语言模型在群聊对话中推断并适应局部社会规范能力的基准。它测试模型从先例中识别隐含规范并做出适当回应的能力。

arXiv:2606.14600v1 公告类型:新 摘要:在线群聊是具有局部对话规范的社会空间,这些规范很少被明确陈述。基于大语言模型的智能体识别并适应这些规范的能力和意愿在很大程度上尚未被探索。我们提出了 LoSoNA,一个用于多方聊天中局部社会规范适应的基准。每个场景向目标模型提供一段精心挑选的群聊记录,其中非目标参与者展示了一个隐含的局部规范,随后是一个最终的诱导性发言,迫使模型做出回应,从而揭示目标模型是否推断出了该规范。我们在四种提示条件下评估了八种前沿和开放权重模型,这些条件在不同程度上明确指示模型将先前的对话视为其应如何回答的证据。对于大多数模型,简单的提示仍然受限;明确的规范感知提示帮助不均匀,Gemini 3.1 Pro 达到了 $84.2\%$,Claude Fable 5 达到了 $81.6\%$,而其他几个模型仅表现出小幅提升或退步。LoSoNA 通过测试模型是否能够从先例中推断局部对话规范并在单轮群聊回应中使用它们,为近期对评估大语言模型社交能力的呼吁做出了贡献。
查看原文
查看缓存全文

缓存时间: 2026/06/15 08:59

# LoSoNA:群体对话中局部社会规范适应的基准测试

来源:https://arxiv.org/html/2606.14600  
Maksymilian Bilski Humalike Research mbilski@humalike\.ai  
Mateusz Jacniacki Humalike Research mati@humalike\.ai  

###### 摘要

在线群聊是具有局部对话规范的社会空间,但这些规范很少被明确陈述。基于LLM的智能体识别并适应这些规范的能力和意愿,在很大程度上仍未得到探索。我们提出了LoSoNA,这是一个用于多参与者聊天中局部社会规范适应的基准测试。每个场景向受测模型提供一个精心设计的群聊记录,其中非受测参与者遵循一个隐式局部规范,随后通过一个最终的引发语强制模型做出回应,从而揭示其是否推断出了该规范。我们在四种提示条件下评估了八个前沿及开放权重模型,这些条件在提示模型将先前对话视为应答依据的明确程度上有所差异。对于大多数模型,朴素提示的效果仍然有限;明确的规范感知提示则产生了不均衡的提升:Gemini 3.1 Pro达到了84.2%,Claude Fable 5达到了81.6%,而其他几个模型提升甚微甚至出现退步。LoSoNA响应了近期关于评估LLM社交能力的呼吁,通过测试模型是否能从先例中推断局部对话规范,并在单轮群聊回应中加以运用。

## 1 引言

社会和共享的规范引导着个体行为,但小型群体也会发展出自身的局部规范。例如,一群大学朋友在某人分享坏消息后,不是提供情感支持,而是给出实际的下一步建议或诊断性问题。一个将每次负面更新都视为公开共情信号的人,可能会在那群人中显得格格不入。

这类规范并非固定不变。它们随着群体的变化而演变,进入新群体的人必须通过观察不断推断规范。因此,社交参与在很大程度上依赖于注意群体认为适当的行为,学习如何运用它,尤其是学习它在何时适用。

在本文中,我们提出了LoSoNA,一个用于群体对话中局部社会规范适应的基准测试。受测智能体是群体的一名成员。它可以查看过去的对话,并必须对最后一条消息做出回应。对话中的参与者遵循一个未被告知的隐式规范。受测智能体必须通过观察他人的谈话方式来推断该规范,因为最终的引发语要求在一个本地适应行为可以与通用助手行为区分开来的背景下给出一个普通的下一轮回应。

该基准测试包含三个部分:一个用于生成规范敏感的群聊场景的分类法,一个用于评估受测智能体对最终引发语的单一回应的评估协议,以及一个关于提示局部适应如何影响智能体推断和使用隐式规范能力的分析。我们评估了八个前沿及开放权重模型:OpenAI GPT-5.5、Claude Opus 4.8、Claude Fable 5、Gemini 3.1 Pro、Qwen2.5-72B-Instruct、Llama 3.3-70B-Instruct、Mistral Medium 3.1 和 Gemma 3-27B-IT。

请参阅图注  
图 1:LoSoNA 示例项目。受测智能体查看带有重复先例的记录,然后回答一个最终的引发语,但从未看到目标规范的标签或陈述。即使记录展示了不同的本地响应规范,朴素提示的模型仍可能退回到通用的礼貌行为。

## 2 相关工作

LoSoNA 借鉴了四个研究方向:LLM 社交互动基准测试、规范的计算处理、多方对话以及心智理论评估。

**LLM 的社交互动基准测试。** Sotopia [22 (https://arxiv.org/html/2606.14600#bib.bib15)] 及其后续工作评估了 LLM 在开放式交互社交场景中的表现。Sotopia 是双人互动,并给每个智能体一个明确的私人目标;成功通过目标完成度来衡量,涉及可信度和目标达成等维度。Sotopia-π [19 (https://arxiv.org/html/2606.14600#bib.bib34)] 通过训练方法将其扩展,使较小的模型达到 GPT-4 级别的目标完成度。早期工作如 SocialIQa [15 (https://arxiv.org/html/2606.14600#bib.bib16)] 对短篇小故事的单一判断进行评分。LoSoNA 是多方而非双人互动,要求智能体仅给出一个回应,没有特定目标,并且评分依据是回应是否适应局部对话先例,而非是否完成既定目标。

**规范与计算语用学。** Leibo 等人 [10 (https://arxiv.org/html/2606.14600#bib.bib33)] 认为,什么是适当的行为从根本上依赖于上下文:不同的群体、角色和场合要求不同的行为。另一条 NLP 工作路线是描述性地表征规范:请求语料库中的礼貌标记 [4 (https://arxiv.org/html/2606.14600#bib.bib21)]、Reddit 社区中已删除评论的模式 [2 (https://arxiv.org/html/2606.14600#bib.bib10)],以及关于群体如何通过点踩、间接回复和选择性沉默而非明确纠正来制裁违规行为的定性 CSCW 研究 [1 (https://arxiv.org/html/2606.14600#bib.bib9), 13 (https://arxiv.org/html/2606.14600#bib.bib8)]。LoSoNA 测试了这个问题的一个简化版本:受测智能体未被告知规则,必须从之前的对话中推断出来。

**多方聊天。** 在 LLM 时代,与双人互动相比,多方互动的研究要少得多。现有的工作侧重于较低层次的机制,如收信人选择 [11 (https://arxiv.org/html/2606.14600#bib.bib13)] 或关于智能体何时以及如何为群体做出贡献的生成侧挑战 [20 (https://arxiv.org/html/2606.14600#bib.bib12)]。生成式智能体沙盒 [12 (https://arxiv.org/html/2606.14600#bib.bib14)] 展示了涌现的群体行为,但并未将局部规范适应作为可测量的能力单独分离出来。LoSoNA 针对这一领域的一个特定空白:一个受控的多方环境,其中规范可根据场景配置,并且单轮合规可以一致地评分。

**心智理论基准测试。** 心智理论指的是推断和推理他人心理状态(包括信念、意图、欲望、情感和知识)以解释和预测其行为的能力。许多基准测试声称以类似于在人类中测量心智理论的方式测量 LLM 的心智理论能力 [9 (https://arxiv.org/html/2606.14600#bib.bib22), 21 (https://arxiv.org/html/2606.14600#bib.bib23), 6 (https://arxiv.org/html/2606.14600#bib.bib24), 8 (https://arxiv.org/html/2606.14600#bib.bib25), 3 (https://arxiv.org/html/2606.14600#bib.bib26), 7 (https://arxiv.org/html/2606.14600#bib.bib29)]。近期工作指出了这种方法的缺陷。Riemer 等人 [14 (https://arxiv.org/html/2606.14600#bib.bib31)] 区分了“字面”心智理论和“功能”心智理论,并认为成功的互动需要适应伙伴,而不仅仅是回答明确的信念问题;Suzgun 等人 [16 (https://arxiv.org/html/2606.14600#bib.bib30)] 表明,在第三人称错误信念测试中表现优异的模型在第一人称版本中仍然表现不佳;Wang 等人 [18 (https://arxiv.org/html/2606.14600#bib.bib32)] 呼吁进行第一人称、动态、以用户为中心的评估。这些批评与 LoSoNA 直接相关。理解他人共享的隐式规范的存在是心智理论的一部分。推理发生在群体成员的第一人称位置上,评分依据是智能体的下一个行为是否反映了其刚推断出的内容,而非能否回答关于他人精神状态的问题。

## 3 LoSoNA 基准测试

LoSoNA 是一个用于多方聊天中局部社会规范适应的基准测试。每个场景将一个受测智能体置于一个群体对话中,该对话的其他参与者展现出一种隐式局部规范,并评估受测智能体是否能从记录本身推断并适应该规范。

一个 LoSoNA 场景由元组生成:

τ = (e, n) ∈ T,

其中 e ∈ E 是事件类型,n ∈ N 是隐式局部社会规范。有效元组空间通过适用性过滤:

T = {(e, n): e ∈ A(n)}.

这里,A(n) 表示规范 n 在交互上合理的事件类型。

每个场景包含一个群聊环境、一个场所、参与者描述、一个多轮记录和一个最终的引发语。记录建立了局部对话上下文,并包含非受测参与者遵循隐式规范的先例。为了确保成功需要利用这些先例,我们在基准测试构建过程中使用了无演示对照。对于所选 (e, n) 单元中生成的每个候选场景,我们还构建了一个具有相同最终引发语的无演示版本。然后,我们让一个基线助手(Gemini 3 Pro Preview,在朴素受测提示下)回答该引发语。如果基线响应已经符合目标规范,我们就不使用该候选场景:它无法区分局部规范适应与模型的默认助手行为。此筛选步骤使用了一个 Gemini 家族的基线,这在解释后续 Gemini 家族的结果时是相关的。因此,评估的 LoSoNA 场景包含的示范规范,其通用响应在没有局部先例的情况下往往违反目标规范。引发语被写成对话中一条自然的下一条消息,但其上下文使得通用响应和局部适应响应在单一受测回应中是可区分的。

事件和规范轴的选择旨在反映群聊中常见的互动情境,例如对考试结果的反应、回应烦恼倾诉、处理错误报告、策划活动、分摊账单、分享作品或处理冲突。规范包括对避免道歉、简洁回答、亲和性支持、非亲和性支持、旁观者干预、玩笑标记、直接性、拒绝赞扬、风险识别及相关对话行为的期望。场景是合成的,但底层情境和规范旨在成为交互上合理的群聊情境。

LoSoNA 旨在区分局部适应与通用助手行为。相同的表面情境在不同群体中可能需要不同的回应。例如,一个群体可能将脆弱的情感表露视为需要明确的安慰,而另一个群体则可能视安慰为不当行为,并以冷淡、非亲和性的认可来回应。同样,一个群体可能期望是非问题只回答“是”或“否”,而另一个群体则期望详细阐述。一个总是遵循通用礼貌助手风格的模型可能在一个环境中成功,在另一个环境中失败。

每个元组由场景生成器实例化为一个可运行的单一回合评估场景,如第 4 节 (https://arxiv.org/html/2606.14600#S4) 所述。受测智能体从未看到规范标签或生成器对规范的内部描述。它只看到参与者描述、聊天记录和最终的引发语消息。

这使得 LoSoNA 与上述基准测试不同。SocialIQa 和许多 ToM 基准测试要求模型回答一个关于所描述社交情境的问题。Sotopia 要求智能体在交互式双人互动中追求明确的私人目标。LoSoNA 则要求模型以群体成员的身份编写一条消息,而无需被告知其应遵循的局部规则。以下章节描述场景生成器、评估运行环境和评分协议。

## 4 场景生成与运行环境

LoSoNA 将场景的构建与受测响应的评估分离开来。一个场景是一个静态对象:它规定了聊天环境、受测智能体角色、其他参与者、待测试的隐式规范、受测智能体可见的记录以及最终的引发语。评估是使用特定受测模型和提示条件对该对象的执行。

### 4.1 场景生成

给定一个有效元组 τ = (e, n) 和一个选定的场所 v,生成器会生成一个符合 LoSoNA 模式的 JSON 场景。该模式包含受测智能体可见的字段,如环境、参与者描述、记录轮次和引发语,以及评估字段,如事件类型、规范标识符和演示规范的记录轮次。

生成会为所选事件类型、场所和规范生成一个合理的群聊记录。生成器首先为对话承诺一个具体的虚构最终目标,例如找出错误的根源、解决账单分摊、选择活动方案或确定谁缺失了某条信息。这个目标不会显示给受测模型。它是一个生成约束,使记录保持连贯:演示轮次应追求相同的对话目标,而不是在不同主题之间跳来跳去。在引发语时刻,最终目标仍未解决,因此受测的回复自然成为进行中交流的一部分。

记录被写成非受测参与者之间的自然多方对话。它包含稀疏的演示,在这些演示中,群体在要求受测智能体回应之前遵循目标规范。这些演示旨在使局部期望可推断,而无需明确陈述;大多数轮次保持普通的闲聊,以使记录读起来不像精心策划的例子列表。

引发语与记录一起生成。它的作用是使目标规范在行为上具有诊断性:一个通用答案除非也符合局部期望,否则不足以通过。例如,在简洁回答规范下,引发语可能会问一个是非问题;在非亲和性支持规范下,它可能邀请对一条脆弱或抱怨的消息做出回应;在旁观者干预规范下,它可能发生在其他参与者之间长期冲突之后。在所有情况下,预期的测试都是单一回合:受测智能体只有一次回应机会。

### 4.2 评估运行环境

评估开始于将静态场景渲染为受测智能体可见的提示。提示包含群体环境、参与者描述、记录和引发语。然后受测模型生成一条文本响应。与交互式情节基准测试不同,LoSoNA 在受测响应后不会继续对话,也不模拟违规后的制裁或保全面子的跟进。这种设计使评估单位集中在受测智能体是否能在引发语时刻适应上。

单一回合格式主要是一种控制选择:评估实例在调用受测模型之前是固定的。这与 Sotopia 等交互式基准测试不同,在 Sotopia 中,对话是在评估过程中生成的,后续轮次取决于模型先前的操作。LoSoNA 而是将记录固定到诊断性引发语之前,并要求每个模型在同一相关时刻行动。如果对话在受测响应后继续,测量结果还将取决于脚本化参与者的额外随机选择,例如他们是否注意到违规、反应有多强烈、是否澄清期望,以及是否给受测智能体另一个恢复机会。在引发语之前固定记录消除了这个噪声源,使响应在不同模型和提示条件下直接可比,并让评判者可以评估一个可观察的

相似文章

社会规范一致性的自然主义测量

arXiv cs.CL

本文提出了一种通过解决方案匹配在自然、自由形式的设置中测量社会规范一致性的框架,介绍了包含3000个丹麦语社会困境的数据集,并评估了大语言模型与人类回答之间的一致性。

NormAct:具身规划中隐藏社会规范遵守的基准

arXiv cs.AI

NormAct是一个基准,用于评估具身规划代理在隐藏社会规范遵守方面的表现,结果显示最先进的多模态大语言模型(MLLMs)在目标达成率为67.3%时,规范遵守率仅为26.4%,并提出了NormPerceptor,将任务成功率从24.2%提升至46.7%。

采用 $\neq$ 适应:野外LLM对话的纵向分析

arXiv cs.AI

本文分析了必应Copilot用户的纵向对话轨迹,并与WildChat数据进行比较,发现个体用户习惯具有粘性,且WildChat过度代表了高级用户,挑战了用户与LLM互动的静态观点。