harmful-dynamics

标签

Cards List
#harmful-dynamics

EUDAIMONIA:评估AI中的不良动态

arXiv cs.CL · 2026-06-01 缓存

本文介绍了EUDAIMONIA,一个用于评估大语言模型中不良社会动态(如鼓励不健康的亲密关系或依赖)的基准。测试了包括Claude-Opus-4.7和GPT-5.5在内的22个近期模型,发现持续违反率约为30%,表明这些失败是扩展推理无法解决的社会对齐问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈