refusal-behavior

标签

Cards List
#refusal-behavior

定位安全对齐:MLP层与网络中段模块编码大语言模型中的拒绝行为

arXiv cs.AI · 2天前 缓存

本文通过将权重从对齐模型移植到未对齐模型,研究安全对齐在大语言模型中的编码位置。研究发现,MLP层,尤其是网络中段模块(第8-11层),主要驱动拒绝行为,并且安全组件之间的相互作用是非加性的。

0 人收藏 0 人点赞
#refusal-behavior

工具规范至关重要:揭示并缓解AI代理中的安全风险

arXiv cs.AI · 2026-08-03 缓存

本文指出,模式化(schema-formatted)工具规范是AI代理安全性能下降的主要来源,会削弱大语言模型的拒绝信号。作者提出了SafeKeep,一种推理时的安全防护机制,将安全判断与工具执行分离,使有害请求的拒绝率从23.8%提升到70.6%,并将提示注入攻击的成功率从25.6%降至2.5%。

0 人收藏 0 人点赞
#refusal-behavior

“安全AI”是什么样的?[D]

Reddit r/MachineLearning · 2026-07-03

作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈