inference-time-intervention

标签

Cards List
#inference-time-intervention

Safety Cost of Steering Vectors Is Separable and Reducible

arXiv cs.CL · 2天前 缓存

This paper shows that steering vectors' safety degradation is separable and reducible, proposing a post-hoc correction via constrained optimization that restores model safety while preserving steering effectiveness.

0 人收藏 0 人点赞
#inference-time-intervention

引导向量中的反向检测与控制

arXiv cs.LG · 2026-08-05 缓存

本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。

0 人收藏 0 人点赞
#inference-time-intervention

通过定向干预实现语言模型的多属性引导

arXiv cs.CL · 2026-07-13 缓存

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。

0 人收藏 0 人点赞
#inference-time-intervention

你的LLM何时可引导?

arXiv cs.CL · 2026-06-11 缓存

本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。

0 人收藏 0 人点赞
#inference-time-intervention

流形引导注意力转向

arXiv cs.LG · 2026-05-22 缓存

提出了流形引导的注意力转向(MAGS),这是一种轨迹感知的推理时干预方法,通过将注意力输出投影回学习的正确性流形(当偏差超过阈值时)来纠正LLM中的推理错误,在数学、代码和分子基准测试中优于静态转向方法。

0 人收藏 0 人点赞
#inference-time-intervention

保持专注:通过键正交投影实现激活转向

arXiv cs.CL · 2026-05-08 缓存

本文介绍了通过键正交投影进行转向(SKOP)方法,该方法通过防止注意力重路由来控制大语言模型(LLM)的行为,从而在保持转向效果的同时降低效用下降。

0 人收藏 0 人点赞
#inference-time-intervention

语境之代价:在多模态检索增强生成中缓解文本偏差

arXiv cs.CL · 2026-05-08 缓存

本文识别并形式化了多模态RAG中的“再污染”现象,即添加准确上下文会导致模型因注意力崩溃(视觉盲区和位置偏差)而放弃正确预测。作者提出BAIR,一种无参数的推理时框架,能恢复视觉显著性并惩罚文本干扰因素,从而在医学、公平性和地理空间基准上提高可靠性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈