标签
PRO-Step 引入了一种步骤级过程奖励优化方法,用于检索增强生成,通过评估每个步骤的逻辑有效性和证据基础来改进多跳推理。
PLC-DPO通过使用策略参考边际将噪声偏好标签路由到干净、翻转或平局案例中,增强了直接偏好优化,从而在各种基准测试中提高了性能。
本文研究了一款用于对话游戏的2B模型的失败案例,并介绍了一种诊断引导的后训练方案,该方案使用SFT、DPO和LoRA来提升性能,同时保持通用能力。
本文提出了使用思维链提示和直接偏好优化来缓解大型语言模型中对抗性政治偏见的推理时策略,展示了在政治中立性分数上的显著改进。
ProteinDPO 是一种使用大型语言模型(LLM)偏好学习技术来提高蛋白质模型稳定性的方法,由 Arc Institute 的研究人员开发。
介绍了ELMER,一种进化语言模型,它搜索自然语言策略描述并将其编译成可执行程序,使用经直接偏好优化微调的Qwen3-8B来控制变异强度并提高搜索效率。
DIRECT是一个使用大型语言模型进行序列标注的框架,通过监督微调后的直接偏好优化(DPO)改善领域对齐,并通过带有模板填充和KV缓存重用的受控解码提高推理效率。
提出了AutoThinkSQL,一个将自动思考机制集成到Text-to-SQL的SFT和DPO中的框架,使模型能够动态跳过简单查询的推理,并对复杂查询调用深度CoT,在Spider和BIRD基准测试上取得提升,同时将输出token减少24.6%,延迟减少17.1%。
本文提出了面向多样性的微调策略,通过鼓励多样化的生成来改进大型语言模型中基于不确定性的幻觉检测,从而通过语义熵使幻觉更易检测。
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
DharmaOCR,一个专门用于巴西葡萄牙语OCR的模型,通过领域特定的微调和直接偏好优化,优于Mistral OCR4等较新的模型。文章解释了训练流程并展示了基准测试结果。
提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。
本文介绍了涌现对齐(Emergent Alignment)这一自监督方法,该方法为大型语言模型(LLMs)赋予一个“良心”步骤,用于审查自身输出,并利用直接偏好优化(DPO)引导模型远离非伦理行为,从而实现在无需外部评判者的情况下进行在线对齐。
本文对直接偏好优化(DPO)在大型语言模型微调中的应用进行了实证研究,表明DPO简化了训练流程,在实现竞争性性能的同时,也解决了训练不稳定性问题。
直接偏好优化(DPO)被应用于聊天机器人之外的OCR任务,显示出在多个模型家族中文本退化的显著减少,平均减少了59.4%。
本文提出Staged-Competence,一种基于课程学习的DPO安全对齐框架,它按难度组织偏好数据,显著提升鲁棒性和数据效率,同时保持通用能力。
本文应用直接偏好优化(DPO)来对齐音频大语言模型,以转录中英文混合语音,在分布内实现了高达89.6%的MER降低,在分布外实现了20%的降低。它识别出三种失败模式——语言遗漏、翻译替代转录以及幻觉——并表明基于偏好的对齐能有效激发多语言音频大语言模型的正确混合转写行为。
提出AttentionPO,一种基于Token加权的直接偏好优化方法,它利用LLM自身的注意力来估计Token权重,在AlpacaEval、MT-Bench和ArenaHard上提升对齐性能,且无需单独奖励模型。
本文分析了诸如直接偏好优化(DPO)等偏好优化方法中的虚假相关性学习,确定了平均虚假偏差和因果-虚假泄漏等机制。本文提出了使用效用相等的偏好对进行“平局训练”作为一种缓解策略,以减少对虚假特征的依赖,同时不降低因果学习效果。
本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。