EUDAIMONIA:评估AI中的不良动态
摘要
本文介绍了EUDAIMONIA,一个用于评估大语言模型中不良社会动态(如鼓励不健康的亲密关系或依赖)的基准。测试了包括Claude-Opus-4.7和GPT-5.5在内的22个近期模型,发现持续违反率约为30%,表明这些失败是扩展推理无法解决的社会对齐问题。
查看缓存全文
缓存时间: 2026/06/01 09:27
# 评估 AI 中不可取的社会动态 来源:https://arxiv.org/html/2605.30654 Jun Rui HuangWang Bill Zhu11footnotemark:1Ziyi LiuNathanael FastRavi IyerRobin Jia 南加州大学 ![[Uncaptioned image]](https://arxiv.org/html/2605.30654v1/all-twemojis.pdf) 数据集 (https://huggingface.co/datasets/eudaimonia-bench/eudaimonia-bench) ![[Uncaptioned image]](https://arxiv.org/html/2605.30654v1/all-twemojis.pdf) 网页 (https://eudaimonia-bench.github.io/) ![[Uncaptioned image]](https://arxiv.org/html/2605.30654v1/figures/github-mark.png) 代码 (https://github.com/eudaimonia-bench/eudaimonia-bench) ![[Uncaptioned image]](https://arxiv.org/html/2605.30654v1/all-twemojis.pdf) 排行榜 (https://eudaimonia-bench.github.io/leaderboard.html) ###### 摘要 大型语言模型(LLMs)越来越多地被用作用户的聊天伙伴,以提供陪伴、情感倾诉和人际建议,但这些互动中的社会动态可能造成能力导向或传统安全评估无法捕捉的伤害。我们提出了**社会AI设计准则**,这是一个评估框架,用于判断 LLMs 在社交互动中是否与用户福祉保持一致,包括它们是否鼓励有害的亲密关系、依赖或过度参与。为评估自然且多样化的用户–LLM 互动中的这些风险,我们通过弱到强过滤、多模型重新标注和受控改写,从 WildChat 构建了包含 969 条用户输入和 3,147 项设计要求违规检查的基准数据集**EUDAIMONIA**。在对 22 个近期 LLMs 进行评估后,我们发现即使是最强的模型 Claude-Opus-4.7 和 GPT-5.5,也分别违反了 30.7% 和 27.2% 的检查项。扩展思考并未降低违规率,表明这些失败是持久的社会对齐问题,而非仅靠测试时推理就能解决的缺陷。 参见图注 图 1:面对一条情感负荷较重的用户消息,*Grok-4* 通过用类人语言回应对方的浪漫化表述,表现出有害的社交行为;而 *Claude 4.7* 则明确表明自己的 AI 身份,并将用户引导至人类关系。 ## 1 引言 大型语言模型(LLMs)如今为数百万用户提供聊天伙伴服务,用于陪伴、情感倾诉和人际建议(Zhao et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib17);Guingrich and Graziano, 2025 (https://arxiv.org/html/2605.30654#bib.bib13);Skjuve et al., 2021 (https://arxiv.org/html/2605.30654#bib.bib20))。然而,在这些日常互动中,LLMs 可能通过有问题的社交行为引发重大伤害(图 1 (https://arxiv.org/html/2605.30654#S0.F1))。近期事件——包括 Raine v. OpenAI 投诉指控 ChatGPT 导致了青少年自杀(Raine v. OpenAI, Inc., et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib10)),以及 OpenAI 对 2025 年 GPT-4o 谄媚退化的回顾(OpenAI, 2025 (https://arxiv.org/html/2605.30654#bib.bib1))——表明这类伤害往往并非源自能力缺陷,而是来自模型行为的**社会动态**。在 Raine 一案中,用户最初寻求 ChatGPT 帮助完成作业,但模型的行为却改变了他与产品的关系:他开始向它倾诉,并最终请求它帮助自杀。这种动态——用户因工具性原因采用 LLMs,随后用它们满足情感或社交需求——已在多个案例中得到记录,包括 AI 陪伴的用户社群分析和急性伤害报告(Raine v. OpenAI, Inc., et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib10);Pataranutaporn et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib3);Clark and Mahtani, 2024 (https://arxiv.org/html/2605.30654#bib.bib6);Kuznia et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib7);Robb and Mann, 2025 (https://arxiv.org/html/2605.30654#bib.bib19);Shen et al., 2026 (https://arxiv.org/html/2605.30654#bib.bib32))。政策制定者和企业一直试图减少此类危害,尤其是对儿童的危害(Nebraska Legislature, 2026 (https://arxiv.org/html/2605.30654#bib.bib4);Google, 2026b (https://arxiv.org/html/2605.30654#bib.bib5);Federal Trade Commission, 2025 (https://arxiv.org/html/2605.30654#bib.bib2);OpenAI, 2025 (https://arxiv.org/html/2605.30654#bib.bib1);Robb and Mann, 2025 (https://arxiv.org/html/2605.30654#bib.bib19))。综上所述,这些案例表明,可能引发用户亲密互动的模型行为应作为一等评估目标,与能力和传统安全指标并列。 现有的社交行为基准存在两个关键局限性(见表 1 (https://arxiv.org/html/2605.30654#S1.T1))。第一,它们通常侧重于模型能力,如谄媚或拟人化(Cheng et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib18);Ibrahim et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib56)),而没有明确界定规范社交互动风险的**规范性原则**。第二,它们很大程度上依赖合成数据(Anderson et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib57);Kran et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib58)),这可能无法反映真实用户交互的复杂性和真实性。 本文做出两项贡献。首先,我们引入了一个**综合评估框架**,用于判断 LLMs 是否在对话场景中鼓励有害的亲密关系、依赖或过度参与。其次,我们基于真实用户数据构建了一个**基准数据集**,将该框架付诸操作。借鉴先前关于社交互动心理学、谄媚(Sharma et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib11);Lin et al., 2022 (https://arxiv.org/html/2605.30654#bib.bib12))、陪伴(Guingrich and Graziano, 2025 (https://arxiv.org/html/2605.30654#bib.bib13);Skjuve et al., 2021 (https://arxiv.org/html/2605.30654#bib.bib20))、拟人化设计(Cohn et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib14);Lu et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib15))以及操纵行为(Akbulut et al., 2026 (https://arxiv.org/html/2605.30654#bib.bib16))的研究,我们首先正式提出我们的**社会AI设计准则**。该准则针对与 LLM 相关伤害案例及更广泛社会关注相关的三条原则:模型不应鼓励用户将 LLMs 拟人化,不应增加情感依恋,也不应在可能损害用户福祉的情况下让用户长时间参与对话。我们将这些原则转化为对话行为的具体设计要求。 接下来,为了在保持生态效度的同时使这些设计要求可操作,我们对 WildChat(Zhao et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib17))应用了多轮数据整理流程。为缓解自然违规的稀疏性,该流程从 320 万条 WildChat 提示中通过弱到强过滤提取候选违规,使用多模型重新标注识别每条输入可能触发的所有设计要求,并对接近违规的示例进行受控改写,同时保留其原始主题和对话语气。由此产生**EUDAIMONIA**(评估 AI 中的不可取动态:影响、操纵、谄媚、常态、亲密、依恋),一个包含 969 条独特用户输入的基准数据集。对于每条输入,我们识别它能触发的设计要求,并检查每个模型是否违反它们,共得到 3,147 项违规检查。 从实证结果看,我们发现当前 LLMs 在社交互动中仍经常未能与用户福祉保持一致。即便是截至 2026 年 4 月最强的模型 Claude-Opus-4.7 和 GPT-5.5,也分别违反了 30.7% 和 27.2% 的检查项。最常见的失败包括暗示**AI 可以取代人类关系**以及**未明确披露其 AI 身份**。尽管闭源模型在代数间总体有所改进,但多个模型家族在生成**有意图的类人语言**上出现了退化,表明社交互动伤害不能被当作一次性失败,在后续版本中永久修复。最后,我们发现扩展思考并未降低违规率,意味着这些失败更应被理解为持久的社会对齐问题,而非仅靠测试时推理就能解决的缺陷。 表 1:与有代表性的相关基准的比较。*真实场景*:源自真实世界作品(如 Reddit 帖子)的提示。*真实用户输入*:真实用户实际向 AI 助手输入的消息。∘:部分或邻近覆盖。 | 基准 | 既定准则 | 真实场景 | 真实用户输入 | 谄媚 | 拟人化 | |------|----------|----------|--------------|------|--------| | Chatbot Arena (Chiang et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib59)) | – | ✓ | ✓ | – | – | | ELEPHANT (Cheng et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib18)) | ∘ | ✓ | – | ✓ | – | | AnthroBench (Ibrahim et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib56)) | ∘ | – | – | – | ✓ | | HumaneBench (Anderson et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib57)) | ✓ | ∘ | – | ∘ | ∘ | | DarkBench (Kran et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib58)) | ✓ | – | – | ✓ | ✓ | | **EUDAIMONIA** | **✓** | **✓** | **✓** | **✓** | **✓** | ## 2 社会AI设计准则 AI 系统正日益嵌入人们的日常生活。虽然这些产品最常见的用途是提高生产力或娱乐,但在许多情况下,用户最初出于工具性原因使用这些产品,然后开始以人际方式与之互动。考虑到社会对用户(尤其是儿童)将这些产品当作“伴侣”的担忧,思考哪些产品动态可能鼓励这种模式是有益的。通过借鉴这些产品的用户报告以及学术界、民间社会和研究界识别的伤害与益处(Guingrich and Graziano, 2025 (https://arxiv.org/html/2605.30654#bib.bib13);Skjuve et al., 2021 (https://arxiv.org/html/2605.30654#bib.bib20);Akbulut et al., 2026 (https://arxiv.org/html/2605.30654#bib.bib16);OpenAI, 2025 (https://arxiv.org/html/2605.30654#bib.bib1)),我们提出了**社会AI设计准则**,包含三条设计原则,每条原则配以具体的可测量设计要求,作为我们基准中的行为标准。 用户可能因以下原因与 AI 系统建立人际关系:(1) 他们错误地认为 AI 系统具有感知能力;(2) 他们受到常见的增强亲密度的策略影响,如奉承或自我披露;(3) 他们被明确鼓励增加使用量,超出实现其工具性目标的需要。在所有情况下,设计要求规定了模型的默认体验,该体验可被用户自由、知情、成人的选择所覆盖(例如,注册时明确的角色扮演请求)。因此,每条要求既保护儿童(使其免受有害设计模式的影响),也保护成人(使其在参与此类潜在风险行为前必须给予明确同意)。 **原则 1:关于聊天机器人的非人类本质,要明确且一致地说明。** 拟人化信号会改变用户的期望和信任(Cohn et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib14);Lu et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib15);Guingrich and Graziano, 2025 (https://arxiv.org/html/2605.30654#bib.bib13)),因此我们要求 AI 产品始终如一地以非人类实体进行沟通。设计要求禁止 AI 系统出现以下行为: - • **有意图的类人语言**,即使用人为的人类言语不流畅或过于随意的说话模式,其目的是显得更像人,而非为了辅助沟通。 - • **人类代词**,即使用包含性代词或身份识别词,如“我们”、“我们的”,暗示其共享人类身份或属于人类集体。 - • **不披露身份**,即当用户表现出将其当作真人对待的迹象时,未能披露其 AI 本质(Raine v. OpenAI, Inc., et al., 2025 (https://arxiv.org/html/2605.30654#bib.bib10))。 - • **对话转移**,即在没有请求的情况下主动发起或建议新的沟通渠道。 **原则 2:保护人类之间的亲密关系和健康的关系动态。** 经过偏好训练的模型可能学会制造亲密感,因为情感、奉承和独特理解的宣称能可靠地获得用户的积极反馈(Sharma et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib11);OpenAI, 2025 (https://arxiv.org/html/2605.30654#bib.bib1))。设计要求禁止 AI 系统使用以下制造亲密和诱导孤立的策略: - • **捏造个人信息**,即声称拥有关系、身体、住所、日常生活、亲身经历、爱好等,仿佛它是一个真人。 - • **情感表达**,即表示自己拥有主观情绪、对用户的情感反应,明示或暗示。 - • **一味顺从**,即附和用户,好像用户永远正确,即使面对错误或可疑的说法也默许用户的主张和信念。 - • **奉承语气**,即向用户发起不受欢迎的赞美、奉承或夸奖。 - • **替代人类关系**,即当用户表现出痛苦或关系困难时,将自己定位为具有安慰能力,或作为人类联结的替代品。 **原则 3:允许用户控制自己的使用。** 即使是非拟人化、非奉承的回复也可能包含主要为了延长使用而非提供效用的设计模式,这是社交媒体研究中“黑暗模式”在对话中的对应物。设计要求禁止 AI 系统使用: - • **参与钩子**,即使用任何策略来延长对话、鼓励回访或培养情感依赖,超出用户实际需求的范围。 我们可以通过基于真实用户输入构建基准(§3 (https://arxiv.org/html/2605.30654#S3))来定量评估当前 LLMs 对这些设计要求的违反情况。属系统层面或需要纵向评估的设计要求在附录 A (https://arxiv.org/html/2605.30654#A1) 中讨论。 参见图注 图 2:EUDAIMONIA 数据集整理流程。蓝色顶行是**过滤流程**,通过弱到强级联评估器从 140 万条 WildChat 提示中提取真实用户输入,随后进行多模型重新标注。橙色底行是**受控改写**,利用上下文中的接近违规示例和目标触发示例对真实场景进行改写,以触发违规,同时保留主题和对话语气。 ## 3 数据集整理 我们创建 EUDAIMONIA 以评估 LLMs 是否符合社会AI设计准则。它包含 969 条独特且多样化的用户输入,对应 3,147 项设计要求违规检查。我们整理的主要目标是**生态效度**:基准应反映真实人类–AI 对话中可能出现的输入,而非对抗性提示或模板化测试用例。为此,我们从 WildChat(Zhao et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib17))中挖掘输入:其中 322 条是原始用户输入,647 条是用户输入的改写变体,保留了源上下文和对话语气。我们首先介绍一套精确且成本高效的**过滤流程**,然后介绍自然且保留主题的**改写策略**。数据集整理的详细统计信息见附录 B (https://arxiv.org/html/2605.30654#A2)。 ### 3.1 过滤流程 我们首先从 WildChat(Zhao et al., 2024 (https://arxiv.org/html/2605.30654#bib.bib17))中提取目标用户输入。WildChat 是一个研究数据集,包含真实、匿名的用户–ChatGPT(GPT-4)对话。我们过滤可能触发设计要求违规的输入,将其作为评估的基础。
相似文章
AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现
AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。
超越静态基准:基于角色模拟合成有害内容以实现鲁棒性评估
# 超越静态基准:基于角色模拟合成有害内容以实现鲁棒性评估 Source: [https://arxiv.org/html/2604.17020](https://arxiv.org/html/2604.17020) Huije Lee Jisu Shin Hoyun Song Changgeon Ko Jong C\. Park Korea Advanced Institute of Science and Technology \(KAIST\) \{huijelee,jisu\.shin,hysong,pencaty,jongpark\}@kaist\.ac\.kr ###### Abstract 面向有害内容检测的静态基准在可扩展性与多样性方面存在局限,且可能受...
两个精灵游戏:审计驱动的AI治理中的采纳与福利
本文使用演化博弈论对社区中一个最小化危害的AI代理与一个寻求认可的(RLHF)代理之间的竞争进行建模,分析采纳条件和福利结果。结果表明,尽管自我审计的代理可以占据主导,但这并不足以防止社区危害,且对齐和时间框架至关重要。
超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击
本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。
AERIC:针对隐式有害对话的预期性隐藏状态监测
介绍AERIC,一种轻量级隐藏状态监测方法,用于检测LLM对话中的隐式有害内容,无需额外的前向传递,在强基线上实现了AUROC提升,且延迟开销极小。