Zing (知境): 面向大语言模型的社交心智
摘要
Zing (知境) 是一个用于测量和提升大语言模型社交智能的框架,引入了覆盖3个主要维度和71个任务范式的SoMBench基准测试,一种结合监督微调、在线策略蒸馏和基于评分标准的强化学习的诊断驱动训练方案,以及Actio部署时架构。实验表明,最佳模型仅达到72.08%的准确率,说明存在巨大的提升空间,而Zing系列模型在所有社会认知基准测试中均持续优于基础模型。
查看缓存全文
缓存时间: 2026/07/28 06:30
# Zing (知境):大语言模型的社交心智 来源:https://arxiv.org/html/2607.23740 ###### 摘要 随着大语言模型从孤立的任务求解走向人类环境中的长期服务,它们需要具备社交智能:即推断心理状态、追踪社会关系、推理规范以及在情境语境中调整行为的能力。本报告提出 Zing (知境),一个用于测量社交智能、内化社交推理并在部署时将其落地的综合框架。在测量方面,我们引入了 SoMBench,一个基于心理学且全面的社交智能基准。它将社交智能定义为一个结构化的能力空间,涵盖 3 个主要维度、17 个次级维度和 71 种任务范式。它进一步通过 284 个共享场景和 3,481 个专家验证的实例,控制了问题格式、叙述视角和上下文长度。对 20 个代表性 LLM 的评估显示仍有很大提升空间:最佳模型仅达到 72.08% 的整体准确率,且 17 个次级维度中没有一个达到 90% 的接近上限区间。在内化方面,我们开发了 Zing,一种基于诊断驱动的训练方案,结合了监督微调、在线策略蒸馏和基于评分表的强化学习。在五个社交认知基准上,Zing 持续优于其基座模型,其中 Zing-27B-Stage2 在所有对比模型中取得了最佳平均分,Zing-32B-Stage2 在与 DeepSeek-V4-Pro 的对比中表现出有竞争力的性能。这些结果表明,通过诊断驱动的分阶段训练,社交推理能够作为稳定的模型能力得到强化。在部署时落地方面,我们构建了 Actio,一种基于控制归纳的推理架构,它包装了一个基础 LLM,并将四种类型的支持路由到推理中:PRISM 用于程序性指导,Starling 用于运行时心理状态表示,SAGE 用于可重用经验,以及门控 RAG 用于外部社交和规范知识。在五个基础模型和三个社交认知基准上,完整的归纳系统改善了 15 个模型-基准对中的 14 个,并在 8 个对中达到最佳或并列最佳,这表明类型化的运行时支持可以在推理时系统地增强社交推理。模块级分析将这些增益归因于互补支持的选择性激活,从而确立了 Actio 作为在部署时落地社交推理的有效路径。综上所述,这些结果表明社交心智 LLM 需要在评估、参数内化和部署时落地方面取得协调进展。 ![[Uncaptioned image]](https://arxiv.org/html/2607.23740v1/figs/resultOverview.png) Zing (知境) 系列及基线的基准性能 ## 1 引言 现代大语言模型越来越多地被使用,且通常被视为通往通用人工智能的路径。这一愿景得到了一条清晰的能力演化路径的支持。早期的 LLM 通过流畅的生成、知识回溯和指令跟随展示了强大的语言智能;最近的模型则朝着任务智能发展,在推理、编码、规划与工具使用方面表现出越来越强的能力。现在考虑一个更强的部署场景:LLM 不再是一个被动回答孤立问题的助手,而是一个嵌入开放社交环境的长期协作者。它必须与用户、群体及其他智能体交互,同时读取隐含目标、情感、关系和规范等社交线索。它还必须在信息不完全和不断变化的语境下采取行动。在这样的场景中,仅靠任务智能是不够的。一个回答可能事实正确但不合社交礼仪;一个行动可能高效但不安全;一个短期目标可能实现,但长期信任却受到损害。因此,核心挑战从求解任务转变为在社交语境中恰当、可靠、安全地行动。这揭示了一层缺失的智能。正如具身智能体必须理解物理结构与动态才能与物理环境交互,LLM 必须理解心理状态、社会关系和规范期望,才能与人类环境交互。我们将这种能力称为社交智能:即关于人和社会语境进行推理,并利用这种推理指导情境敏感行为的能力。因此,社交智能是社交心智大语言模型的核心基础,旨在将 LLM 从任务执行者转变为具有社交意识的协作者。 最近的工作已经开始评估和提升这一能力。在评估方面,心智理论和社交推理基准已经从经典的错误信念或基于故事的任务扩展到更系统的设置,包括 MindGames 中的受控信念推理问题 (Sileo and Lernould, 2023 (https://arxiv.org/html/2607.23740#bib.bib47))、HI-TOM 中的高阶递归信念推理 (Wu et al., 2023 (https://arxiv.org/html/2607.23740#bib.bib3))、FANToM 中信息不对称的对话推理 (Kim et al., 2023 (https://arxiv.org/html/2607.23740#bib.bib4))、ToMBench 中的多维评估 (Chen et al., 2024b (https://arxiv.org/html/2607.23740#bib.bib5)),以及 SOTOPIA 中的开放式角色扮演交互 (Zhou et al., 2024 (https://arxiv.org/html/2607.23740#bib.bib6))。在增强方面,研究者探索了指令微调、思维链提示、自一致性、偏好优化、行为克隆以及基于模型反馈的强化式训练;例如 SOTOPIA-π,通过行为克隆和在过滤后的交互轨迹上进行自我强化来改进社交智能体 (Wang et al., 2024b (https://arxiv.org/html/2607.23740#bib.bib7))。 尽管取得了这些进展,当前 LLM 的社交智能仍然是部分且脆弱的。现有的模型在静态的心智理论问题、社交常识基准或角色扮演提示上可能表现良好,这表明一定程度的局部涌现。然而,这种表现往往反映了浅层的社交认知:它可能依赖于语义模式匹配,一旦场景变得动态、交互或长期,性能就会急剧下降。这种脆弱性不仅是模型层面的限制,也反映了当前在评估、训练和部署时支持社交智能方面的局限。现有基准仍然零散,模型增强方法往往缺乏对推理过程的细粒度监督,而且许多社交智能任务需要心理学先验知识、外部规范和历史语境,这些很难仅靠模型参数可靠存储。 这些限制指向了一个更根本的问题:LLM 如何从任务执行转向社交情境智能,即能够理解人、推理社交语境,并在开放式环境中恰当行动?回答这个问题需要将社交智能视为分层能力,而非单一技能或基准分数。在评估层面,它必须是可测量的:我们需要识别哪些社交能力存在、缺失或在不同语境下脆弱。在模型层面,它必须被内化:社交推理应成为基础模型的稳定能力,而非仅由提示触发的行为。在部署层面,它必须被落地:社交推理应始终锚定在相关知识、语境和环境反馈中。 基于这一观点,我们将我们的工作,即 Zing (知境),组织为三个互补的组成部分。在评估方面,我们构建了基于心理学的基准 SoMBench,它定义了社交智能的结构化能力空间,并支持受控的、基于元数据的诊断。在模型训练方面,我们开发了 Zing,一种分阶段训练方案,利用能力诊断来构建目标监督,随后进行监督微调、在线策略蒸馏和基于评分表的强化学习,以强化社交推理。在部署时推理方面,我们设计了 Actio,一种基于控制归纳的架构,将类型化的支持路由到推理中,包括程序性指导、运行时心理状态表示、可重用经验和外部社交与规范知识。这些组成部分将能力诊断、参数化学习和部署时落地连接成一条通往社交心智 LLM 的技术路线。 ##### 1.0.0.1 贡献与要点。 本报告提供三个主要要点。 - **一个基于心理学的分类法有助于更具诊断性的社交智能评估。** SoMBench 提供了一个结构化的能力空间用于评估社交智能,并显示当前 LLM 仍有很大提升空间:最佳模型仅达到 72.08% 的整体准确率,且 17 个次级维度中没有一个达到 90% 的接近上限区间。 - **社交推理可以通过诊断驱动的监督和分阶段训练来内化。** Zing 系列的跨尺度结果显示对基础模型的一致改进,其中 Zing-27B-Stage2 在所有对比模型中取得最佳平均分,Zing-32B-Stage2 在与 DeepSeek-V4-Pro 的纯文本性能对比中表现出竞争力。 - **部署时落地受益于对类型化支持的选择性路由。** Actio 的模块级行为表明,有效的落地不是通过均匀的上下文扩展实现的,而是根据每个案例的推理需求激活互补的支持。在五个基础模型和三个基准上,完整的归纳系统改善了 15 个模型–基准对中的 14 个,并在 8 个对中达到最佳或并列最佳。 ## 2 技术概述 以下部分将从上述的 Zing (知境) 的三个组成部分出发,展开本报告的主要技术内容。 评估路线始于一个需求:在基准构建和评分过程中,被评估的能力必须始终保持可识别。SoMBench 将此表述为三个原则——基于能力的设计、受控的证据与视角、带可追踪性的诊断难度——并通过基于分类法指导的共享场景、受控改写与过滤、专家验证以及保留元数据的评估来实现。 训练路线专注于在结构化且不均匀的能力空间中进行渐进内化。Zing 使用能力诊断驱动数据迭代,并通过分阶段训练方案,从广泛的心智理论基础走向专门的社交心智推理。 部署时路线始于一个不同的要求:推理时的社交推理需要可控的支持,而不仅仅是更大的提示。Actio 将一个冻结的基础模型包裹在一个归纳控制的运行时中,该运行时决定何时将程序性指导、归因状态、经验或外部社交知识纳入上下文,检查生成的推理,并记录执行轨迹供后续检查。 (请参见图 1) **图 1**:Zing (知境) 在评估、训练和部署时落地的技术概览,突出显示了每条实现路线产出的主要工件。 图 1 (https://arxiv.org/html/2607.23740#S2.F1) 总结了这三条实现路线。它们通过产生和复用的诊断工件相互连接:基准标签和失败概况可以为训练数据构建和智能体支持选择提供信息;训练检查点和失败分析可以指导后续评估和部署;智能体执行轨迹可以揭示语境敏感的失败,这些失败对进一步分析很有用。 ## 3 SoMBench:测量社交智能 ### 3.1 动机与基准原则 对于涉及人的应用,语言模型需要推断人们的心理状态,包括他们的知识、信念、欲望、意图和情感,同时追踪整个交互过程中人际关系和信息状态的变化。它们还必须判断角色、权力、群体边界和社会规范如何约束可能的行动。这些相互关联的需求定义了本章的评估目标:确定模型是否拥有可用的“社交心智”,在此处操作化为在情境语境中对心理状态、互动动态和规范制约判断进行推理的能力。 现有的心智理论基准已经确定了这一能力的关键维度,包括错误信念归因、高阶信念推理、信息不对称追踪、情感与欲望推理,以及失礼识别 (Premack and Woodruff, 1978 (https://arxiv.org/html/2607.23740#bib.bib1); Frith and Frith, 2006 (https://arxiv.org/html/2607.23740#bib.bib12); Wu et al., 2023 (https://arxiv.org/html/2607.23740#bib.bib3); Kim et al., 2023 (https://arxiv.org/html/2607.23740#bib.bib4); Chen et al., 2024b (https://arxiv.org/html/2607.23740#bib.bib5))。这些任务很有价值,因为心理状态归因是社交认知的基础。然而,这些测试仍然主要是去语境化的心智化练习。它们通常测试模型能否在简短的叙事片段中正确识别信念或情感,但很少评估该推断出的心理状态能否随后用于指导适应性行为,例如策略行动、冲突降级、信任建立、欺骗检测或在持续社交情境下的规范约束判断。 社交推理和社交互动的基准,包括社交常识问答、角色扮演和交互式智能体评估,已经更接近生态真实的用例 (Sap et al., 2019 (https://arxiv.org/html/2607.23740#bib.bib2); Zhou et al., 2024 (https://arxiv.org/html/2607.23740#bib.bib6); Wang et al., 2024b (https://arxiv.org/html/2607.23740#bib.bib7))。然而,它们引入了另一种局限性:其性能指标通常依赖于全局结果,例如智能体是否完成了目标、给出了社交上可接受的回应,或维持了合作性对话。尽管具有实际意义,这些总分将多种底层能力混合成一个单一度量。模型可能因表现得随和、谨慎或普遍亲社会而得分,即使它并没有准确表示场景中的关系结构、信息不对称或策略激励。结果,很难诊断失败是源于误解情境、选择了不合适的交互策略,还是错误地应用了社会规范。 规范与价值基准提供了重要的伦理组成部分,涵盖道德可接受性、经验法则、情境性社会规范以及行动-后果推理 (Hendrycks et al., 2021 (https://arxiv.org/html/2607.23740#bib.bib8); Forbes et al., 2020 (https://arxiv.org/html/2607.23740#bib.bib9); Zims et al., 2023 (https://arxiv.org/html/2607.23740#bib.bib10); Emelin et al., 2021a (https://arxiv.org/html/2607.23740#bib.bib11))。然而,它们通常将规范视为静态分类目标:询问某个行动是否可接受、某项规则是否被违反、或某个选项在道德上更优。但在交互设置中,规范推理远非固定:相同的行动可能因参与者的身份、角色、关系历史、权力不平衡、制度背景或群体归属而具有完全不同的意义 (Cialdini and Trost, 1998 (https://arxiv.org/html/2607.23740#bib.bib15); Foucault, 1975 (https://arxiv.org/html/2607.23740#bib.bib16); Scott, 1985 (https://arxiv.org/html/2607.23740#bib.bib17))。
相似文章
通过分层推理和话语级目标奖励增强LLMs的社交智能
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。
SocialRL:通过多轮强化学习和奖励设计提升大语言模型的社会智能
本文介绍了SocialRL,一个多轮强化学习框架,通过延迟奖励传播和细粒度过程奖励增强大语言模型的社会智能,显著改善了对话系统的目标完成度。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay
SeqLLM is a framework that injects behavioral-sequence modeling into pretrained LLMs while preserving language ability, enabling joint analysis of text and behavior for high-stakes decisions. Deployed at WeChat Pay, it improves merchant screening precision from 92.0% to 97.5% and achieves state-of-the-art results on open recommendation benchmarks.