标签
GrandGuard 针对老年人在大语言模型聊天机器人交互中的特定风险,提出了一套全面的分类体系、基准测试与防护措施。研究发现,主流大语言模型对超过50%的此类风险处理不当,并提出了两种防护措施,检测准确率最高可达96.2%。
VERA-MH是一个经过临床验证的评估框架,用于评估聊天机器人在心理健康支持中的安全性,重点关注自杀意念风险。它使用角色扮演对话和一个LLM-as-a-Judge(以LLM作为评判)结合临床评分规则来评估回复。