inference-time-alignment

标签

Cards List
#inference-time-alignment

超越全球规范:无需重新训练的语言模型毒性敏感性个性化

arXiv cs.CL · 2026-07-28 缓存

本文首次对推理时无需训练的语言模型毒性敏感性个性化方法进行了比较评估,显示所有方法均能将对齐错误减少28-47%,但揭示了对齐效果、个性化与语言质量之间的权衡。

0 人收藏 0 人点赞
#inference-time-alignment

干预还是不干预:使用概率模型融合引导推理时对齐

arXiv cs.LG · 2026-06-11 缓存

本文介绍了BlendIn,一个推理时对齐框架,它使用概率模型融合来评估指导可靠性并按比例加权模型贡献,通过避免有害干预实现了高达50%的性能提升。

0 人收藏 0 人点赞
#inference-time-alignment

面向组合奖励的流模型冲突感知加性引导

arXiv cs.AI · 2026-05-22 缓存

本文识别了组合奖励下引导流模型中的流形外漂移,并提出冲突感知加性引导(CAR),这是一种轻量级方法,可动态解决梯度冲突,从而无需重新训练即可提升生成保真度。

0 人收藏 0 人点赞
#inference-time-alignment

面向执行轨迹的推理时对齐框架

arXiv cs.LG · 2026-05-22 缓存

本文研究LLM智能体的框架设计,将其分解为任务拆解和引导执行,并展示了更精细的框架并非一致更好;它揭示了失败模式,并提出了部分框架的有效性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈