chatbot-safety

标签

Cards List
#chatbot-safety

GrandGuard:面向老年人与聊天机器人交互安全的分类体系、基准测试与防护措施

arXiv cs.AI · 2026-05-22 缓存

GrandGuard 针对老年人在大语言模型聊天机器人交互中的特定风险,提出了一套全面的分类体系、基准测试与防护措施。研究发现,主流大语言模型对超过50%的此类风险处理不当,并提出了两种防护措施,检测准确率最高可达96.2%。

0 人收藏 0 人点赞
#chatbot-safety

VERA-MH:心理健康领域伦理与负责任AI的验证

arXiv cs.AI · 2026-05-14 缓存

VERA-MH是一个经过临床验证的评估框架,用于评估聊天机器人在心理健康支持中的安全性,重点关注自杀意念风险。它使用角色扮演对话和一个LLM-as-a-Judge(以LLM作为评判)结合临床评分规则来评估回复。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈