PLC-DPO:在噪声和模糊偏好优化中的后验标签校正
摘要
PLC-DPO通过使用策略参考边际将噪声偏好标签路由到干净、翻转或平局案例中,增强了直接偏好优化,从而在各种基准测试中提高了性能。
查看缓存全文
缓存时间: 2026/09/14 02:33
论文页面 - PLC-DPO:带噪声和歧义偏好优化中的后验标签校正
来源:https://huggingface.co/papers/2608.30597
摘要
后验标签校正 DPO 通过使用校准的策略-参考边际将带噪声的成对标签路由为清洁、翻转或平局案例,从而改进偏好优化。
直接偏好优化(https://huggingface.co/papers?q=Direct%20Preference%20Optimization)(DPO)通过成对比较简化了对齐过程,但假设所有观测到的偏好都是可靠的。真实数据经常违反这一假设,导致标签反转、微弱或模糊,从而引起有害的策略更新。为了解决这个问题,我们提出了后验标签校正 DPO(https://huggingface.co/papers?q=Posterior%20Label%20Correction%20DPO)(PLC-DPO),通过将每对训练信号路由为清洁、翻转或平局案例,以鲁棒地优化偏好。其关键思想是使用校准的策略-参考边际(https://huggingface.co/papers?q=policy-reference%20margin)作为在线证据,采取适当的校正操作。这将带噪声的偏好学习(https://huggingface.co/papers?q=preference%20learning)重新定义为主动校正监督方向和强度,而不仅仅是过滤可疑样本。在 57 个数据集-模型-基准单元上,PLC-DPO 在对阵 DPO 时获得了最佳平均胜率(60.5 对比次优方法的 55.5)。注入噪声和平局压力测试、人类分歧分析以及自我确认诊断进一步表明,该路由保持稳定,并能区分翻转案例与弱方向性案例。
查看 arXiv 页面 (https://arxiv.org/abs/2608.30597) 查看 PDF (https://arxiv.org/pdf/2608.30597) GitHub 仓库 (https://github.com/VennTum99/PLC-DPO) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.30597)
在您的智能体中获取此论文:
hf papers read 2608.30597
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.30597 以从本页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.30597 以从本页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.30597 以从本页面链接。
包含此论文的收藏 0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
xi-DPO:通过比率奖励边际的直接偏好优化
本文介绍了 xi-DPO,这是一种新颖的偏好优化方法,通过将目标重构为最小化与最优比率奖励边际的距离,解决了 SimPO 中的超参数调整难题。实验结果表明,xi-DPO 在开放基准测试中优于现有方法。
Data-DPO: 用于LLM后训练中目标模型数据选择的直接偏好优化
Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。
GroupDPO:内存高效的分组直接偏好优化
GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。
噪声偏好标签下无元数据的元加权直接偏好优化
本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。
DPO与RLHF的条件等价性:隐含假设、失败模式与可证明的对齐
本文证明了直接偏好优化(DPO)与基于人类反馈的强化学习(RLHF)之间的等价性是有条件的,并且在实践中经常被违反,揭示了DPO优化相对优势而非绝对对齐的失败模式。作者引入了约束偏好优化(CPO)以实现可证明的对齐,并展示了最先进的性能。