标签
SAGE 提出了一种群体级别的不确定性目标,该目标在采样响应上构建基于答案条件的不确定性几何结构,以改进大语言模型中的口头不确定性对齐,并引入了 GUPO 进行训练。跨推理任务的实验表明,不确定性排序得到改善,过度自信有所减少。
本文对六种偏好优化方法(PPO、DPO、SimPO、ORPO、GRPO、KTO)在三种开源模型系列上进行了系统性的机制分析,通过探针和稀疏自编码器揭示了对齐算法如何以不同的方式重塑内部表示。
DOG-DPO 是一种无需训练的数据选择框架,它将偏好对视为结构化几何信号,将多数据集偏好几何分解为锚定子空间和残差子空间,以选择多样化的子集用于安全对齐。该框架在六个安全基准测试中仅使用 11% 的偏好对就实现了强大的效用-鲁棒性权衡。
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
Z-Reward 是一个教师-学生框架,它将复杂推理与高效的奖励部署解耦,用于文本到图像的训练。该框架使用 27B 教师模型达到了 89.6% 的人类偏好准确率,使用 9B 学生模型达到了 88.6%,超过了先前的方法。
全面指南:2026年重要的15种策略优化和偏好优化技术,包括GRPO、DPO、REINFORCE++及众多新变体,描绘推理强化学习方法论的图景。
本文介绍了偏好差值聚合(PDA)和几何对齐合并(GAM),通过LoRA合并将来自弱模型对的多个“弱”偏好信号进行聚合,在知识推理和智能体搜索任务上平均将强LLM的性能提升超过6%。
介绍了HDSR和HDSR-PL方法,这些方法使用幻觉检测器来指导迭代自我改进和偏好学习,在MIMIC-IV-Note上使用Llama和Gemma模型进行临床摘要时,幻觉减少高达48%。
本文介绍了BiDPO,这是一个通过基于偏好的微调和区域级引导来增强文本到图像模型处理复杂组合提示的框架,在组合保真度基准上达到了最先进的性能。
介绍WeCon,一种用于多目标组合优化问题的权重条件神经求解器,其超体积与现有最优方法相当,同时推理时间减少40%。
本文证明了直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)之间的等价性是有条件的,并且在实践中经常被违反,揭示了DPO优化相对优势而非绝对对齐的失败模式。作者引入了约束偏好优化(CPO)以实现可证明的对齐,并展示了最先进的性能。
提出AttentionPO,一种基于Token加权的直接偏好优化方法,它利用LLM自身的注意力来估计Token权重,在AlpacaEval、MT-Bench和ArenaHard上提升对齐性能,且无需单独奖励模型。
本文提出CTO方法,通过对比学习和直接偏好优化结合语法引导与语义感知偏好优化来改进代码翻译,在C++、Java和Python翻译中显著优于现有基线。
本文分析了诸如直接偏好优化(DPO)等偏好优化方法中的虚假相关性学习,确定了平均虚假偏差和因果-虚假泄漏等机制。本文提出了使用效用相等的偏好对进行“平局训练”作为一种缓解策略,以减少对虚假特征的依赖,同时不降低因果学习效果。
本文介绍了 YFPO,这是一种神经元引导的偏好优化框架,利用内部激活信号来提高大型语言模型在数学推理方面的能力。
本文介绍了 Macro,一种使用 DPO 进行偏好对齐的框架,旨在提高跨多种语言自我生成反事实解释的有效性和最小性。
本研究探讨了在Llama-3.2-3B和Qwen-3-4B等小型语言模型上使用偏好优化方法(ORPO、AlphaPO),通过微小数据集使其与斯多葛哲学对齐。研究发现,尽管300个样本可以有效编码斯多葛美德,但小型模型在处理外向型的宇宙公民义务时仍面临困难。
本文介绍了一种用于大语言模型的拓扑增强对齐框架,利用基于持续同调的轨迹拓扑损失和拓扑偏好优化,对隐藏空间中的语义轨迹进行正则化。
本文介绍了PNAPO,一种针对整流流模型的离线偏好优化框架,该框架通过噪声样本增强偏好数据,并采用动态正则化来提高训练效率和样本效率。
FSPO提出了一种用于大语言模型个性化的少样本偏好优化算法,该算法将奖励建模重新定义为元学习,使模型能够从有限的用户偏好中快速推断出个性化的奖励函数。该方法通过精心构建合成偏好数据集,在合成用户上实现了87%的个性化性能,在真实用户上实现了70%的个性化性能。