dpo

标签

Cards List
#dpo

ConnectED:面向越南教学备课与学生学习的课程对齐AI系统

arXiv cs.AI · 2026-08-03 缓存

本文介绍了ConnectED,一个面向越南教育的以人为中心的AI系统,利用VietEduQwen大语言模型支持课程对齐的备课和互动式学生学习,将教师备课时间从数小时缩短至约30-45分钟,同时在全国考试题目上达到87%的准确率。

0 人收藏 0 人点赞
#dpo

顺应阻力:偏好优化的LLM咨询师在动机性访谈中可能以目标坚持换取关系协调

arXiv cs.CL · 2026-08-03 缓存

本文研究偏好优化如何塑造LLM咨询师在动机性访谈中的行为,发现惩罚对抗行为会以目标坚持为代价换取关系协调,而不是教会平衡的“顺应阻力”技能。

0 人收藏 0 人点赞
#dpo

偏好优化的归一化奖励

arXiv cs.LG · 2026-07-21 缓存

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

0 人收藏 0 人点赞
#dpo

@h100envy:前摩根大通工程师、LLM 课程作者在18分钟内详解微调与合并——比…更好

X AI KOLs Timeline · 2026-07-15 缓存

一位 LLM 课程背后的前摩根大通工程师提供了一份18分钟的指南,关于使用 LoRA、QLoRA、DPO、KTO 和 mergekit 微调与合并模型,声称其效果优于昂贵的训练营。

0 人收藏 0 人点赞
#dpo

噪声偏好标签下无元数据的元加权直接偏好优化

arXiv cs.LG · 2026-07-14 缓存

本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。

0 人收藏 0 人点赞
#dpo

D2PO:通过动态偏好优化扩散采样器

arXiv cs.LG · 2026-07-09 缓存

D2PO提出了一种动态偏好优化框架,利用直接偏好优化使扩散采样策略与感知质量对齐,在低NFE约束下优于基于回归的方法。

0 人收藏 0 人点赞
#dpo

PASTA:一种用于LLM知识更新的释义与自训练方法

arXiv cs.CL · 2026-06-30 缓存

PASTA是一种新颖的LLM知识更新框架,结合数据增强、问答生成和自学习DPO技术,整合新闻文章中的事实信息,在保持通用能力的同时,将准确率从0.02提升至0.82。

0 人收藏 0 人点赞
#dpo

LLM后训练中应比较哪些配对?

arXiv cs.AI · 2026-06-20 缓存

本文研究了LLM后训练中如何选择需要标注的完成对以供人类偏好反馈的问题。它将比较筛选问题形式化为采样设计问题,给出了DPO策略最优性差距的理论上界,并提出了实用的采样设计方案,在合成和真实基准测试上比常规启发式方法更有效地提高了样本效率。

0 人收藏 0 人点赞
#dpo

预测性数据调试:在训练前揭示并塑造模型所学(11分钟阅读)

TLDR AI · 2026-06-12 缓存

这项研究介绍了一种方法,利用可解释性在训练前预测DPO将从偏好数据集中放大或抑制哪些行为,从而实现数据调试以防止不良影响。该技术达到了R²=0.9的预测准确率,并集成到了Goodfire的Silico平台中。

0 人收藏 0 人点赞
#dpo

超越金牌教师:通过LLM-GNN协同教学增强图学习

arXiv cs.LG · 2026-06-11 缓存

本文提出LLM-GNN协同教学(LLM-GNN Co-Teaching),一种面向文本属性图的小样本图学习的双向框架。LLM和GNN交换高置信度的伪标签,并利用基于轮次的偏好优化(RPL-PO)相互改进,在基准测试上优于先前方法。

0 人收藏 0 人点赞
#dpo

在领域特定任务上,使用约3美元的API调用和零人工标注,将Qwen2.5-7B微调至Claude Haiku的96%性能

Reddit r/LocalLLaMA · 2026-06-10

提出DV-DPO方法,仅用约3美元的API调用和零人工标注,即可在领域特定任务上微调Qwen2.5-7B,通过对抗性交叉检验达到Claude Haiku综合性能的96%。

0 人收藏 0 人点赞
#dpo

通过最差维度优化改进多模态推理

arXiv cs.AI · 2026-06-09 缓存

本文提出了多模态多维度标量化过程奖励建模(MMS-PRM),该方法在多模态推理中强制最差维度的鲁棒性,以防止视觉幻觉等失败被强大的文本逻辑掩盖。

0 人收藏 0 人点赞
#dpo

DOG-DPO:面向安全对齐的几何动态优化

arXiv cs.LG · 2026-06-09 缓存

DOG-DPO 是一种无需训练的数据选择框架,它将偏好对视为结构化几何信号,将多数据集偏好几何分解为锚定子空间和残差子空间,以选择多样化的子集用于安全对齐。该框架在六个安全基准测试中仅使用 11% 的偏好对就实现了强大的效用-鲁棒性权衡。

0 人收藏 0 人点赞
#dpo

@TheTuringPost: 2026年重要的15种策略优化和偏好优化技术 GRPO DPO REINFORCE++ DAPO(动态采样…

X AI KOLs Timeline · 2026-06-07 缓存

全面指南:2026年重要的15种策略优化和偏好优化技术,包括GRPO、DPO、REINFORCE++及众多新变体,描绘推理强化学习方法论的图景。

0 人收藏 0 人点赞
#dpo

VCIFBench:评估视频理解中的复杂指令遵循能力

arXiv cs.CL · 2026-06-04 缓存

VCIFBench 是一个用于评估视频理解中复杂指令遵循能力的新基准,包含 306 条带有内容、格式、风格和结构约束的测试指令,以及一个 DPO 偏好数据集。针对 10 个 MLLM 的实验表明,同时满足多项约束仍具挑战性,而基于该基准数据进行 DPO 训练可提升指令遵循性能。

0 人收藏 0 人点赞
#dpo

超越聊天机器人的直接偏好优化

Hugging Face Blog · 2026-06-03 缓存

直接偏好优化(DPO)被应用于聊天机器人之外的OCR任务,显示出在多个模型家族中文本退化的显著减少,平均减少了59.4%。

0 人收藏 0 人点赞
#dpo

@yuwen_lu_: 看了一半,我靠怎么从来没人告诉我rl这么好玩

X AI KOLs Timeline · 2026-05-30 缓存

Sanbu 散步发布了现代RL教程Hands-On Modern RL,涵盖从CartPole+PPO入门到LLM后训练(RLHF、DPO、GRPO)和Agentic RL,代码先行,英文版即将更新。

0 人收藏 0 人点赞
#dpo

CroCo:基于自生成的跨语言对比偏好调优

arXiv cs.CL · 2026-05-27 缓存

本文介绍了CroCo,一种基于自生成响应的跨语言对比偏好调优方法,表明在英语偏好上训练的奖励模型能够有效对其他语言的响应进行排序,在无需特定语言标注的情况下,提升模型在14种语言上的性能。

0 人收藏 0 人点赞
#dpo

@neural_avb: 下一个视频是关于训练小型(<1B)模型用于偏好调优。以及如何使用本地模型生成偏好数据集…

X AI KOLs Timeline · 2026-05-26 缓存

宣布即将发布一个关于训练小型模型用于偏好调优的视频,涵盖奖励模型、RLHF、DPO、ORPO,以及Unsloth和TRL的使用。

0 人收藏 0 人点赞
#dpo

DPO与RLHF的条件等价性:隐含假设、失败模式与可证明的对齐

arXiv cs.AI · 2026-05-22 缓存

本文证明了直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)之间的等价性是有条件的,并且在实践中经常被违反,揭示了DPO优化相对优势而非绝对对齐的失败模式。作者引入了约束偏好优化(CPO)以实现可证明的对齐,并展示了最先进的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈