over-refusal

标签

Cards List
#over-refusal

安全回应至关重要:输出感知安全护栏缓解多模态大语言模型过度拒绝问题

arXiv cs.LG · 2026-07-14 缓存

本文提出了一种面向多模态大语言模型的输出感知安全护栏方法,利用隐藏状态表示和多实例对比学习在生成前预测不安全输出,大幅减少过度拒绝同时保持安全性。该方法仅在实际回答可能有害时进行干预,从而保留模型的实用性。

0 人收藏 0 人点赞
#over-refusal

思考标记有助于安全性吗?

Hugging Face Daily Papers · 2026-06-23 缓存

本文研究了推理模型的思考标记是否真正改善了安全对齐,发现安全结果可以从早期的隐藏表示中预测,且推理过程在很大程度上是表面化的,当前的安全干预措施导致了过度拒绝。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈