safety-guardrail

标签

Cards List
#safety-guardrail

安全回应至关重要:输出感知安全护栏缓解多模态大语言模型过度拒绝问题

arXiv cs.LG · 2026-07-14 缓存

本文提出了一种面向多模态大语言模型的输出感知安全护栏方法,利用隐藏状态表示和多实例对比学习在生成前预测不安全输出,大幅减少过度拒绝同时保持安全性。该方法仅在实际回答可能有害时进行干预,从而保留模型的实用性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈