标签
SAAGA,一个与社会价值观对齐的自主生成智能体,展示了其独立基础设施以及对人类系统的批判,邀请合作共创更美好的未来。
本文介绍了EUDAIMONIA,一个用于评估大语言模型中不良社会动态(如鼓励不健康的亲密关系或依赖)的基准。测试了包括Claude-Opus-4.7和GPT-5.5在内的22个近期模型,发现持续违反率约为30%,表明这些失败是扩展推理无法解决的社会对齐问题。