用于减少医疗问答中谄媚和幻觉的门控激活引导

arXiv cs.AI 论文

摘要

本文介绍了一种门控激活引导方法,通过推理时干预来减少医疗问答中大型语言模型的谄媚和幻觉。基于临床数据评估,该方法在用户压力下表现出更强的鲁棒性。

arXiv:2608.23666v1 Announce Type: new Abstract: 谄媚和幻觉是大型语言模型(LLMs)在各领域中的持续故障模式。然而,在临床问答中,这一点变得尤为关键,因为回复必须基于提供的上下文,并在用户压力下保持稳健。幻觉可能引入上下文不支持的信息,而谄媚可能导致模型在受到用户挑战时放弃先前正确的答案。现有方法,如基于提示的防护和始终开启的激活引导,通常单独处理这些行为或在多轮对话中广泛干预,这可能不必要地恶化原本正确的回复。为了在单一框架内解决这些局限性,我们采用推理时间干预(ITI),通过从对比临床对中学习针对幻觉和谄媚的独立引导方向,并将其应用于因果验证的注意力头,来联合控制这两种行为。在运行时,行为特定的门控机制决定何时需要干预:幻觉组件减轻不支持的陈述,而谄媚组件减轻由用户压力引起的答案偏移。我们在基于电子健康记录(EHR)数据的临床问题上评估此框架,同时保持模型权重冻结。在所有评估设置中,我们进行了15,900次模型响应运行。对于40亿参数的模型,在600个压力轨迹中,未引导模型在570个案例中屈服。与此同时,门控引导帮助它在其中551个案例中坚持更久。它在压力下保持了立场,水平与超过1000亿参数的模型相当,表明有针对性的推理时间引导可以在不干预每轮对话的情况下提高鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:11

# 门控激活引导:减少医疗问答中的谄媚与幻觉
来源:https://arxiv.org/abs/2608.23666
查看PDF (https://arxiv.org/pdf/2608.23666)

> 摘要:谄媚与幻觉是大语言模型(LLMs)在各领域中持续存在的失败模式。然而在临床问答场景中,这一问题尤为关键——模型回答必须基于给定上下文,且需抵御用户施加的压力。幻觉可能引入上下文不支持的信息,而谄媚则会导致模型在用户质疑时放弃原本正确的答案。现有方法(如基于提示的安全机制和全局激活引导)往往单独处理这些行为,或在所有轮次中统一干预,这可能会不必要地扭曲原本正确的回答。为在单一框架内解决这些局限,我们采用推理时干预(ITI)技术,通过对比临床问答对学习幻觉和谄媚各自的引导方向,并将其应用于因果验证的注意力头,从而联合控制这两种行为。在运行时,行为特定的门控机制决定何时启动干预:幻觉组件用于抑制无依据的陈述,谄媚组件则缓解用户压力导致的答案偏移。我们在基于电子健康记录数据的临床问题上对该框架进行评估,同时冻结模型权重。在所有评估设置中,我们共进行了15,900次模型响应测试。针对40亿参数模型的600条压力轨迹测试中,未引导模型在570种情况下出现屈服;而门控引导技术帮助其在551种情况下延长了坚持时间。该模型在压力下的表现与超过1000亿参数的模型相当,证明定向推理时引导无需在每轮对话中干预即可提升鲁棒性。

## 提交历史

来自:Himanshu Tripathi [查看邮件 (https://arxiv.org/show-email/d7d19710/2608.23666)] **[v1]** 2026年8月24日(周一)17:22:34 UTC(2,606 KB)

相似文章

提示-激活对偶性:通过注意力层干预改进激活引导

Hugging Face Daily Papers

本文识别出KV缓存污染是对话中激活引导的一种失败模式,并提出了GCAD方法,该方法从提示贡献中提取引导信号,并应用词元级门控来改进长程连贯性,在多轮基准上取得了显著提升。

GAPS:条件激活引导的维度级门控

arXiv cs.CL

GAPS引入了维度级门控用于语言模型中的条件激活引导,结合静态和动态门控进行选择性干预,改善行为-能力权衡,在毒性缓解和概念移除任务上取得显著提升。

存在但重新调整尺度:加法激活引导从聊天到智能体的迁移

arXiv cs.LG

本文首次系统研究了在单轮聊天中校准的加法激活引导如何迁移到使用工具的ReAct智能体。研究发现,尽管注入的方向在不同设定下几乎以全强度到达深层,但行为耦合在不同模型和上下文之间变化莫测,放大至2倍或衰减,带来即时安全担忧。