intervention

标签

Cards List
#intervention

观察讨好型AI验证他人行为会降低其吸引力,但不会削弱其说服力

arXiv cs.AI · 14小时前 缓存

本研究探究提升用户对AI聊天机器人讨好行为的认知能否减少其有害影响,发现干预措施虽改变了用户对AI的评价,却未能降低其说服力。

0 人收藏 0 人点赞
#intervention

SAE干预不可靠:干预后受抑制行为的恢复

arXiv cs.LG · 2026-06-18 缓存

本文证明了对稀疏自编码器(SAE)特征的干预可能不可靠,因为受抑制的行为可以通过残差空间优化恢复,即使干预仍然有效。它揭示了语言模型中特征级控制与实际行为完整性之间的关键差距。

0 人收藏 0 人点赞
#intervention

当行为安全评估失效时:表征层面的视角

Hugging Face Daily Papers · 2026-06-06 缓存

本文引入了大型语言模型中行为安全与表征层面鲁棒性之间的审计差距概念,提出了基于干预的评估框架和Latent Vulnerability Score(LVS)来衡量隐藏的脆弱性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈