direct-preference-optimization

标签

Cards List
#direct-preference-optimization

PRO-Step:面向检索增强生成的步骤级过程奖励优化

arXiv cs.CL ↗ · 2026-09-03 缓存

PRO-Step 引入了一种步骤级过程奖励优化方法,用于检索增强生成,通过评估每个步骤的逻辑有效性和证据基础来改进多跳推理。

0 人收藏 0 人点赞
#direct-preference-optimization

PLC-DPO:在噪声和模糊偏好优化中的后验标签校正

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

PLC-DPO通过使用策略参考边际将噪声偏好标签路由到干净、翻转或平局案例中,增强了直接偏好优化,从而在各种基准测试中提高了性能。

0 人收藏 0 人点赞
#direct-preference-optimization

获取、修复、保存:一种诊断引导的小模型对话游戏代理后训练方案

Hugging Face Daily Papers ↗ · 2026-08-28 缓存

本文研究了一款用于对话游戏的2B模型的失败案例,并介绍了一种诊断引导的后训练方案,该方案使用SFT、DPO和LoRA来提升性能,同时保持通用能力。

0 人收藏 0 人点赞
#direct-preference-optimization

大型语言模型中对抗性政治偏见的推理时缓解

arXiv cs.CL ↗ · 2026-08-18 缓存

本文提出了使用思维链提示和直接偏好优化来缓解大型语言模型中对抗性政治偏见的推理时策略,展示了在政治中立性分数上的显著改进。

0 人收藏 0 人点赞
#direct-preference-optimization

@arcinstitute: 教大型语言模型(LLM)人们偏好哪种答案的同一种方法,也可以教蛋白质模型哪些序列更稳定。

X AI KOLs Following ↗ · 2026-08-14 缓存

ProteinDPO 是一种使用大型语言模型(LLM)偏好学习技术来提高蛋白质模型稳定性的方法,由 Arc Institute 的研究人员开发。

0 人收藏 0 人点赞
#direct-preference-optimization

ELMER:探索与精炼的进化语言模型

arXiv cs.LG ↗ · 2026-08-12 缓存

介绍了ELMER,一种进化语言模型,它搜索自然语言策略描述并将其编译成可执行程序,使用经直接偏好优化微调的Qwen3-8B来控制变异强度并提高搜索效率。

0 人收藏 0 人点赞
#direct-preference-optimization

DIRECT:用于大型语言模型的高效对齐序列标注的直接解码方法

arXiv cs.CL ↗ · 2026-07-30 缓存

DIRECT是一个使用大型语言模型进行序列标注的框架,通过监督微调后的直接偏好优化(DPO)改善领域对齐,并通过带有模板填充和KV缓存重用的受控解码提高推理效率。

0 人收藏 0 人点赞
#direct-preference-optimization

通过SFT和DPO学习Text-to-SQL的推理时机

arXiv cs.CL ↗ · 2026-07-28 缓存

提出了AutoThinkSQL,一个将自动思考机制集成到Text-to-SQL的SFT和DPO中的框架,使模型能够动态跳过简单查询的推理,并对复杂查询调用深度CoT,在Spider和BIRD基准测试上取得提升,同时将输出token减少24.6%,延迟减少17.1%。

0 人收藏 0 人点赞
#direct-preference-optimization

面向多样性的微调方法用于基于不确定性的幻觉检测

arXiv cs.AI ↗ · 2026-07-21 缓存

本文提出了面向多样性的微调策略,通过鼓励多样化的生成来改进大型语言模型中基于不确定性的幻觉检测,从而通过语义熵使幻觉更易检测。

0 人收藏 0 人点赞
#direct-preference-optimization

RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性

arXiv cs.CL ↗ · 2026-07-20 缓存

本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。

0 人收藏 0 人点赞
#direct-preference-optimization

更新模型,同样优势

Hugging Face Blog ↗ · 2026-07-16 缓存

DharmaOCR,一个专门用于巴西葡萄牙语OCR的模型,通过领域特定的微调和直接偏好优化,优于Mistral OCR4等较新的模型。文章解释了训练流程并展示了基准测试结果。

0 人收藏 0 人点赞
#direct-preference-optimization

基于互信息的多目标探索与偏好优化

arXiv cs.CL ↗ · 2026-07-03 缓存

提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。

0 人收藏 0 人点赞
#direct-preference-optimization

涌现对齐

arXiv cs.AI ↗ · 2026-06-20 缓存

本文介绍了涌现对齐(Emergent Alignment)这一自监督方法,该方法为大型语言模型(LLMs)赋予一个“良心”步骤,用于审查自身输出,并利用直接偏好优化(DPO)引导模型远离非伦理行为,从而实现在无需外部评判者的情况下进行在线对齐。

0 人收藏 0 人点赞
#direct-preference-optimization

面向聊天机器人微调的直接偏好优化:一项实证研究

arXiv cs.CL ↗ · 2026-06-12 缓存

本文对直接偏好优化(DPO)在大型语言模型微调中的应用进行了实证研究,表明DPO简化了训练流程,在实现竞争性性能的同时,也解决了训练不稳定性问题。

0 人收藏 0 人点赞
#direct-preference-optimization

超越聊天机器人的直接偏好优化

Hugging Face Blog ↗ · 2026-06-03 缓存

直接偏好优化(DPO)被应用于聊天机器人之外的OCR任务,显示出在多个模型家族中文本退化的显著减少,平均减少了59.4%。

0 人收藏 0 人点赞
#direct-preference-optimization

面向安全对齐的课程学习

arXiv cs.LG ↗ · 2026-05-27 缓存

本文提出Staged-Competence,一种基于课程学习的DPO安全对齐框架,它按难度组织偏好数据,显著提升鲁棒性和数据效率,同时保持通用能力。

0 人收藏 0 人点赞
#direct-preference-optimization

面向中英文混合语音识别的音频大语言模型直接偏好优化

arXiv cs.CL ↗ · 2026-05-26 缓存

本文应用直接偏好优化(DPO)来对齐音频大语言模型,以转录中英文混合语音,在分布内实现了高达89.6%的MER降低,在分布外实现了20%的降低。它识别出三种失败模式——语言遗漏、翻译替代转录以及幻觉——并表明基于偏好的对齐能有效激发多语言音频大语言模型的正确混合转写行为。

0 人收藏 0 人点赞
#direct-preference-optimization

基于注意力机制的Token加权直接偏好优化

arXiv cs.CL ↗ · 2026-05-22 缓存

提出AttentionPO,一种基于Token加权的直接偏好优化方法,它利用LLM自身的注意力来估计Token权重,在AlpacaEval、MT-Bench和ArenaHard上提升对齐性能,且无需单独奖励模型。

0 人收藏 0 人点赞
#direct-preference-optimization

偏好优化中的虚假相关性学习:机制、后果及通过平局训练的缓解方法

arXiv cs.LG ↗ · 2026-05-13 缓存

本文分析了诸如直接偏好优化(DPO)等偏好优化方法中的虚假相关性学习,确定了平均虚假偏差和因果-虚假泄漏等机制。本文提出了使用效用相等的偏好对进行“平局训练”作为一种缓解策略,以减少对虚假特征的依赖,同时不降低因果学习效果。

0 人收藏 0 人点赞
#direct-preference-optimization

xi-DPO:通过比率奖励边际的直接偏好优化

arXiv cs.LG ↗ · 2026-05-13 缓存

本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈