attention-layers

标签

Cards List
#attention-layers

别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响

arXiv cs.LG ↗ · 2026-06-25 缓存

本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。

0 人收藏 0 人点赞
#attention-layers

探究隐式潜在轨迹偏移:通过长篇幅连贯上下文绕过对齐

Reddit r/ArtificialInteligence ↗ · 2026-06-17

一项实证研究,研究长篇幅、语义密集的良性文本如何偏移模型的潜在空间轨迹,稀释初始系统提示,并绕过训练后对齐约束——如在闭源和开源模型中所观察到的那样。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈