harm-taxonomy

标签

Cards List
#harm-taxonomy

一年后...伤害依旧,但我们仍在!

arXiv cs.CL · 2026-06-24 缓存

本研究评估了六种专有大型语言模型(LLMs)在16种DSM-5病症中通过对抗性攻击的表现,发现安全防护措施仅对自杀和自伤可靠,而对进食障碍、物质使用障碍等其他病症的失败率高达100%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈