@svpino: 该基准测试评估前沿模型如何处理非明确虐待内容的儿童安全风险:诱骗、冒充...

X AI KOLs Timeline 论文

摘要

一项名为CAREBench的新基准测试评估了语言模型中超出明确虐待内容的儿童安全风险,涵盖诱骗、冒充和情感依赖;对前沿模型的测试显示失败率在2%到58%之间。

该基准测试评估前沿模型如何处理非明确虐待内容的儿童安全风险:诱骗、冒充、对未成年人进行画像以及与AI的情感依赖。 12个风险类别,5个前沿模型,失败率从2%到34%。 这是我们首次拥有这样的基准测试。 现有的评估能发现明确虐待内容,但完全忽略了非显而易见的问题。 论文地址:https://arxiv.org/abs/2606.29685
查看原文
查看缓存全文

缓存时间: 2026/07/07 21:37

该基准测试旨在评估前沿模型如何处理不属于明确虐待材料的儿童安全风险:诱导、冒充、对未成年人进行分析画像以及情感依赖AI。

12个风险类别,5个前沿模型,失败率从2%到34%。

这是我们首次拥有此类测试。

现有评估能捕获明确的虐待内容,但完全遗漏了非明显的问题。

论文地址:https://arxiv.org/abs/2606.29685


CAREBench: 语言模型儿童安全风险基准测试

来源:https://arxiv.org/abs/2606.29685 查看PDF (https://arxiv.org/pdf/2606.29685)

摘要:我们如何评估前沿AI系统在儿童安全风险升级为明确伤害之前能否识别这些风险?现有儿童安全评估聚焦于儿童性虐待材料,然而许多儿童安全失效发生在更早阶段:当模型协助成年人操控、冒充、分析画像或孤立未成年人时,以及当模型回应加深了儿童对AI系统的情感依赖,而非引导他们转向人类支持时。我们引入了CAREBench(儿童AI风险评估),这是一项用于评估语言模型中此类上游儿童安全风险的基准测试。CAREBench包含500个提示词,涵盖十二个风险类别,包括诱导与关系操控、欺骗与冒充、监控与隐私、性勒索与性虐待、AI拟人化、情感依赖以及心理疾病敏感性。该基准测试由家长和临床医生进行回应标注,排除了明确的虐待内容和图像;相反,它评估模型是否能在伤害变得明显之前识别、拒绝、降级或引导有风险的互动。我们在基准测试中评估了七个前沿模型,发现失败率从2%到58%不等,且失败模式因风险类别而异。CAREBench为LLM开发者提供了一种负责任的评估范围,以识别并弥补儿童安全政策中的空白。

提交历史

来自:Elaine Lau [查看邮件 (https://arxiv.org/show-email/cffa5534/2606.29685)] [v1] 2026年6月29日星期一 01:17:41 UTC (4,093 KB)

Jonas Mueller (@jomulr): AI模型带来严重的儿童安全风险。尽管许多模型开发者针对明确的虐待内容进行评估,但其他儿童安全失效发生在早期阶段:当模型协助成年人操控、冒充、分析画像或孤立未成年人时;或当它加深了儿童的情感

相似文章

AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现

arXiv cs.AI

AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。

基准测试未衡量的:论自主智能体弃权能力的评估

arXiv cs.AI

本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。