inference-time-steering

标签

Cards List
#inference-time-steering

LARA:残差流中的轻量级适配器,用于可组合的适应与对齐

arXiv cs.LG ↗ · 2026-08-03 缓存

LARA 是一种高效适应方法,它向冻结模型的残差流添加低秩修正,而不是修改权重,在匹配 LoRA 性能的同时实现可组合行为和推理时调控。

0 人收藏 0 人点赞
#inference-time-steering

RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。

0 人收藏 0 人点赞
#inference-time-steering

GrAInS:基于梯度的归因方法用于大语言模型和视觉语言模型的推理时引导

arXiv cs.CL ↗ · 2026-07-13 缓存

GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。

0 人收藏 0 人点赞
#inference-time-steering

QPILOTS: 面向流策略的高效测试时Q引导

arXiv cs.LG ↗ · 2026-06-16 缓存

QPILOTS是一种方法,通过使用从噪声中间状态投影的评论家梯度,在推理时引导流策略,在离线到在线强化学习基准上实现了最先进的性能,并在不修改基础策略的情况下改进了预训练的VLA模型。

0 人收藏 0 人点赞
#inference-time-steering

FineSteer: 大规模语言模型推理时细粒度控制的统一框架

arXiv cs.CL ↗ · 2026-04-20 缓存

FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈