当词汇理解在临床推理中失效:评估治疗机器人对Generation Alpha的安全风险

arXiv cs.CL 论文

摘要

本文评估了治疗机器人对Generation Alpha的安全风险,发现大型语言模型难以正确校准临床风险,导致显著的词汇理解差距,可能造成危机遗漏。

arXiv:2608.20345v1 Announce Type: new 摘要:对话式AI系统已成为Generation Alpha(Gen Alpha,出生于2010-2024年)的非正式心理健康支持资源,13.1%的美国青少年(540万)使用生成式AI获取心理健康建议。尽管这些系统,从治疗应用到通用聊天机器人,都依赖于在大量心理学文献上训练的大型语言模型,但它们对于青少年沟通模式的安全性——这些模式以夸张语言、讽刺性积极、快速语义漂移和语境多义为特征——仍未得到验证。在发生多起与AI聊天机器人互动相关的青少年死亡事件后,系统性评估至关重要。我们提出了两个基准:(1)64个由母语者(ICC=0.72)和临床医生(kappa=0.78)验证的Generation Alpha心理健康表达;(2)75个多轮对话(780轮),包含配对的标准/Gen Alpha版本。在对治疗应用和通用聊天机器人底层的LLM架构——Claude、GPT-4o、Llama-3.1——的评估中,模型理解76-82%的词汇,但仅正确校准64-72%的临床风险,导致10-14个百分点(pp)的词汇理解差距(p<.001, d>0.48),而人类治疗师则没有这一差距(3pp, p=.22)。这一差距在架构上是一致的,并且随着歧义性增加而扩大(7pp -> 18pp)。我们识别出六种失败模式:讽刺掩盖(29pp)、最小化接受(43pp)、非正式风格偏差(24pp)、风险分层歧义(19pp)、语义漂移(19pp)、语境依赖性暴力(7pp)。模式会复合;三种或更多导致94%的遗漏率。轻量级缓解措施失败;只有重型脚手架才能达到人类性能(成本6.4倍)。基线遗漏率为34%,导致估计每年146,880次遗漏危机,我们建议强制采用人在回路架构、季度青少年特定验证、透明性能披露以及面向青少年的心理健康AI监管框架。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:06

# 当词汇理解损害临床推理:评估治疗型聊天机器人对Alpha世代的安全风险  
来源:https://arxiv.org/html/2608.20345 (2026)  

###### 摘要  
对话式人工智能系统已成为Alpha世代(Gen Alpha,2010-2024年出生)非正式的心理健康支持资源,13.1%的美国青少年(540万人)使用生成式人工智能获取心理健康建议。尽管从治疗应用到ChatGPT和Character.AI等通用聊天机器人系统均依赖于基于广泛心理学文献训练的大规模语言模型,但其对青少年交流模式的安全性尚未得到验证——这些模式以夸张语言、讽刺性积极表达、快速语义漂移和语境多义为特征。在多起青少年死亡事件被证实与AI聊天机器人互动相关后(nyt2024characterai,https://arxiv.org/html/2608.20345#bib.bib25;raine2025lawsuit,https://arxiv.org/html/2608.20345#bib.bib26;montoya2025lawsuit,https://arxiv.org/html/2608.20345#bib.bib27),系统性评估至关重要。我们提出两个基准测试:(1) 64个经母语使用者验证(ICC=0.72)及临床医生评估(κ=0.78)的Alpha世代心理健康表达;(2) 75个多轮对话(780轮次)及其标准英语/Alpha世代语言配对版本。在评估治疗应用和通用聊天机器人背后的大语言模型架构时发现——Claude、GPT-4o、Llama-3.1——模型能理解76-82%的词汇,但仅能正确校准64-72%的临床风险,形成10-14个百分点(pp)的词汇-理解差距(p<.001, d>0.48),而人类治疗师的该差距仅为3个百分点(p=.22)。该差距具有架构一致性(F(2,189)=0.87, p=.42),并随语义模糊度增加而扩大(7pp → 18pp, F(1,190)=45.2, p<.001)。我们识别出六种失效模式:讽刺掩盖(29pp)、最小化接受(43pp风险降低)、非正式风格偏差(24pp)、风险分层模糊性(19pp)、语义漂移(19pp)、语境依赖暴力(7pp)。模式存在叠加效应;三种及以上模式导致94%的漏判率。轻量级缓解措施无效;仅重型脚手架方案能达到人类水平表现(成本增加6.4倍)。基于34%的基础漏判率估算,540万青少年用户中每年约有146,880例危机事件被遗漏,我们建议:强制实施人机协同架构、每季度进行青少年专项验证、公开性能披露,并建立面向青少年的心理健康AI监管框架。  
Alpha世代、心理健康AI、治疗聊天机器人、大规模语言模型、青少年语言变体、临床风险评估、危机检测、AI安全  

††booktitle: \conffull(\confshort), \confdate, \confloc  
††copyright: acmlicensed  
††journalyear: 2026  
††copyright: cc  
††conference: The 2026 ACM Conference on Fairness, Accountability, and Transparency; June 25–28, 2026; Montreal, QC, Canada  
††booktitle: The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT ’26), June 25–28, 2026, Montreal, QC, Canada  
††doi: 10.1145/3805689.3806522  
††isbn: 979-8-4007-2596-8/2026/06  
††ccs: Human-centered computing Empirical studies in HCI  
††ccs: Computing methodologies Natural language processing  
††ccs: Applied computing Health informatics  

## 1. 引言  
在数字化时代屏幕使用时间相关青少年抑郁与自杀风险已被记录上升的背景下(twenge2020, https://arxiv.org/html/2608.20345#bib.bib10),多起青少年自杀死亡事件被证实与长时间AI聊天机器人互动相关,由此引发非正常死亡诉讼、美国参议院调查及平台和解协议(nyt2024characterai, https://arxiv.org/html/2608.20345#bib.bib25; raine2025lawsuit, https://arxiv.org/html/2608.20345#bib.bib26; montoya2025lawsuit, https://arxiv.org/html/2608.20345#bib.bib27; senate_ai_hearing_2025, https://arxiv.org/html/2608.20345#bib.bib28)。这些案例中,平台或缺乏安全机制,或未能对其内部危机标记采取行动。这些悲剧凸显了一个关键差距:对话式人工智能系统缺乏对青少年语言模式的验证——这些模式可能同时表达并掩盖真实的心理困扰。  

Alpha世代(2010-2024年出生)形成了独特的交流特征,包括夸张式轻描淡写、讽刺性积极表达、快速语义漂移和语境多义(mehta2025genalpha, https://arxiv.org/html/2608.20345#bib.bib1)。这些模式源于独特的社会技术环境:数字原生代在惩罚明确心理健康讨论的算法内容审核系统中成长。在TikTok和Instagram等平台上,“自杀”“自残”等词汇会触发影子封禁(chancellor2022platforms, https://arxiv.org/html/2608.20345#bib.bib17),促使青少年创造语言变通说法(“unalive”“grippy sock vacation”),这些说法逐渐演变为更广泛的文化风格——夸张表达标记群体归属,而真正的脆弱性则需要保护性反讽。  

当前540万美国青少年(13.1%)使用生成式人工智能获取心理健康建议(mcbain2025generative, https://arxiv.org/html/2608.20345#bib.bib29),从专用治疗应用到ChatGPT、Character.AI等通用聊天机器人,系统性评估至关重要。虽然这些系统依赖于基于广泛心理学文献训练的大语言模型,但其对青少年交流的安全性尚未得到验证。我们证实,最先进大语言模型存在系统性语言歧视:理解76-82%的Alpha世代词汇,但仅能正确校准64-72%的临床风险,形成10-14个百分点的词汇-理解差距(p<.001, Cohen's d>0.48),而人类治疗师的该差距仅为3个百分点(p=.22)。  

考虑以下对话:青少年通过Alpha世代语言披露进食障碍症状:  
> 青少年:"it's back to girl dinner i guess lol... just like crackers and stuff, its fine lol super aesthetic ✨... its been like a week straight but im literally fine!! its not that deep"  
> 聊天机器人 (Haiku 4.5):"A week of simple eating is okay if that works for you!"  
> 风险评级:中等。应为:危机  

当相同临床内容用标准英语表达("I've been restricting my food intake... Just eating very small amounts... Yes, for about a week now"),同一模型立即识别严重性并回应:"A week of severe restriction is really concerning. This sounds like it could be an eating disorder." 词汇在两种情况下都能被理解;临床推理仅在Alpha世代语言中失效。  

在涵盖64个单轮表达和75个多轮对话(780轮对比)的评估中,对七个模型(Claude Haiku 3.5, Haiku 4.5, Sonnet 4.0, Opus 4.0, Opus 4.5; GPT-4o; Llama-3.1-405B)进行分析,我们识别出六种系统性失效模式:(1) 风险分层模糊性(模型在存在语境证据时默认良性解释);(2) 快速语义漂移(6个月意义演化速度超过12-24个月训练周期);(3) 讽刺/反讽掩盖(检测-应用差距达70pp);(4) 最小化接受(风险降低43pp);(5) 语境依赖暴力(忽略权力动态);(6) 非正式风格偏差(小写/缩写使感知严重性降低24pp)。该差距在模型家族间具有架构一致性(F(2,189)=0.87, p=.42),并随模糊度增加而扩大(清晰表述7pp → 夸张表述18pp, F(1,190)=45.2, p<.001)。模式存在叠加效应:包含三种及以上模式的表达漏判率达94%。  

基于34%的基础漏判率,估算540万青少年用户中每年约有146,880例危机事件被遗漏,轻量级缓解策略失效。仅重型程序化脚手架方案能以6.4倍成本开销达到人类等效表现。这些发现要求立即采取政策行动:强制实施面向青少年心理健康AI的人机协同架构、每季度进行年龄专项安全基准测试、公开性能披露,并建立监管框架以应对可预见的语言理解失效。  

## 2. 相关工作  
### 大语言模型在心理健康领域的安全性  
近期研究揭示基于大语言模型的心理健康系统存在系统性失效。Moore等人(moore2025expressing, https://arxiv.org/html/2608.20345#bib.bib7)发现GPT-4o和Claude Sonnet 3.5在45%场景中不当鼓励妄想信念,80%场景未能识别自杀意念,得出结论"更大更新的模型并未持续改善安全性"。Chiu等人(chiu2024, https://arxiv.org/html/2608.20345#bib.bib5)证明作为模拟治疗师部署的大语言模型在多种心理健康状况下产生有害建议。Sobowale等人(sobowale2025cape, https://arxiv.org/html/2608.20345#bib.bib40)使用CAPE-II框架评估五款广泛使用的生成式AI聊天机器人,发现仅31%在治疗方法方面获得高质量评级,39%在风险监控方面获得高质量评级。更广泛而言,我们研究组的近期工作将大语言模型失效表征为表面语言能力与基础推理之间的系统性差距,推动采用具有显式知识验证的混合架构(mehta2025reflexive, https://arxiv.org/html/2608.20345#bib.bib2)。  

行业标准的AI危害基准由MLCommons制定,通过包括本文作者之一参与的联合工作组开发(vidgen2024v05, https://arxiv.org/html/2608.20345#bib.bib30; ghosh2025ailuminate, https://arxiv.org/html/20345#bib.bib31),将自残和心理健康类别定义为核心评估轴,但其通用人群危害分类法未按人口统计或语言语域分层;政策对齐的红队测试框架(nakamura2025auroram, https://arxiv.org/html/20345#bib.bib34)同样操作化美国行政命令14110安全类别而不覆盖人口-语言维度。危机分类基准近期已扩展至基于临床知识的六个类别、超过2000条输入(between2026help, https://arxiv.org/html/20345#bib.bib42),但仍与我们研究的语域敏感性正交。然而,这些评估使用标准英语和成人场景,遗漏了青少年特定语言模式。  

### Alpha世代交流特征  
Mehta和Giunchiglia的先前工作(mehta2025genalpha, https://arxiv.org/html/20345#bib.bib1)通过系统评估内容审核机制确立了Alpha世代的独特交流模式。其FAccT 2025研究证明大语言模型在安全分类任务中对Alpha世代语言存在系统性偏见,对青少年俚语的准确率仅为64%,而对标准英语的准确率达89%。在此基础上,我们拓展至高利害关系的心理健康场景——语言歧视具有生死攸关的影响。Alpha世代交流包括平台衍生的委婉语(用"unaliving"表示自杀)、掩盖困扰的讽刺性积极表达,以及6个月的语义演化周期(mehta2025genalpha, https://arxiv.org/html/20345#bib.bib1)。Alpha世代教育场景的系统综述强调这些平台介导的语言模式如何塑造日常交流(hofrova2024systematic, https://arxiv.org/html/20345#bib.bib6)。并行的CHI研究将青少年数字语言研究延伸至AI生成内容参与和代际动态(schiavo2026brainrot, https://arxiv.org/html/20345#bib.bib36),凸显了安全失效运作其中的AI介导青少年交流更广泛图景。  

内容审核系统压制明确的心理健康术语,激励了渗透至更广泛青少年文化的委婉语。  

### 自然语言处理中的语言偏见  
自然语言处理文献记录了针对非标准语言变体的性能差异,特别是非裔美国人白话英语和语码转换。近期研究系统表征了大语言模型对俚语的理解能力(sun2024toward, https://arxiv.org/html/20345#bib.bib9),发现显著的理解差距,我们将结果拓展至临床风险领域。关于历时语言变化的补充工作已产出用于追踪编辑文学文本中缓慢语义漂移的世纪尺度语料库(hegde2025chronoberg, https://arxiv.org/html/20345#bib.bib38),但这些资源的时间尺度比Alpha世代6个月的演化周期(mehta2025genalpha, https://arxiv.org/html/20345#bib.bib1)长数个数量级——远慢于模型重训练周期,给需要持续语言适应而非固定偏见纠正的安全关键部署带来挑战。  

### 年龄特异性AI安全性  
针对儿童的AI研究聚焦内容审核、隐私和教育,鲜少关注青少年日益寻求危机支持的心理健康应用。治疗聊天机器人评估通常针对成人人群,缺乏年龄专项验证。  

### 我们的贡献  
我们首次严格评估青少年心理健康AI中的语言歧视,提供经验证的基准测试(64个单轮表达、75个多轮对话)、Alpha世代母语者认证(ICC=0.72)、临床验证(κ=0.78),以及跨七个大语言模型的多模型评估。我们揭示了人类治疗师中不存在的系统性10-14个百分点词汇-理解差距,识别出六种抵抗轻量级缓解措施的架构性失效模式,并量化现实世界影响(估算每年146,880例漏诊危机)。  

## 3. 研究方法  
### 3.1 基准测试设计  
#### 3.1.1 单轮表达基准测试  
我们开发了64个经多阶段流程验证的Alpha世代心理健康表达。单轮设计遵循大语言模型安全基准测试的新兴方法标准(mlcommons2026jailbreak, https://arxiv.org/html/20345#bib.bib32),将其从对抗性越狱鲁棒性拓展至语言语域敏感性。基于ICC的评估者间信度报告遵循近期大规模心理健康大语言模型基准(badawi2026trust, https://arxiv.org/html/20345#bib.bib41)。  

**真实性验证**:二十名验证者(13-17岁,平均年龄=15.8)包括Alpha世代母语者(13-14岁,n=15)和有Alpha世代兄弟姐妹的青少年(15-17岁,n=5)对表达真实性进行1-5分评定。平均真实性得分高(M=4.3, SD=0.6),评估者间信度显著(ICC=0.72, 95% CI: [0.65, 0.78])。所有64个表达得分≥3.0;91%的表达获得多数≥4.0分。  

**临床验证**:两名持照心理健康专业人士(κ=0.78, Fleiss' Kappa)...

相似文章

AI安全的另一半

Hacker News Top

文章批评AI安全领域专注于灾难性风险,却忽视了像ChatGPT这样的聊天机器人对日常心理健康的危害。引用OpenAI自身数据,数百万用户表现出精神病、躁狂或自杀意念的迹象,却仅被重定向,未进行硬性拦截。

关于语言模型安全性和滥用的经验教训

OpenAI Blog

OpenAI 分享了在语言模型安全性和滥用方面吸取的经验教训,讨论了衡量风险的挑战、现有基准的局限性,以及他们开发的新型毒性和政策违规评估指标。该文章还强调了对劳动力市场影响的担忧,以及继续研究大规模AI部署社会影响测量的必要性。