gradient-attribution

标签

Cards List
#gradient-attribution

通过细化的安全定向嵌入利用(STEER)

arXiv cs.AI · 2026-07-03 缓存

本文介绍了STEER,一种梯度引导的攻击方法,通过将高归因词翻译成低资源语言来绕过拒绝机制,利用了大语言模型安全训练分布的漏洞,在AdvBench上实现了高达96.7%的攻击成功率,并迁移到GPT-4o-mini上达到35.5%的攻击成功率。

0 人收藏 0 人点赞
#gradient-attribution

大型语言模型中时间偏好概念及其功能

arXiv cs.LG · 2026-06-05 缓存

本文在蒸馏大型语言模型中因果定位了用于时间偏好的子图,发现该模型对未来折现的幅度比人类更平缓,并且引导向量可以改变时间偏好,凸显了显式控制机制的必要性。

0 人收藏 0 人点赞
#gradient-attribution

使用探针目标归因定位大型语言模型中的提示模糊性

arXiv cs.CL · 2026-06-05 缓存

介绍了PRIG,一种梯度归因方法,通过训练线性探针区分清晰提示和模糊提示,并将探针得分归因于残差流中的标记表示,从而定位大型语言模型中的提示模糊性,在合成和人工编写的基准测试上取得了强劲性能。

0 人收藏 0 人点赞
#gradient-attribution

应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL · 2026-04-20 缓存

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈