标签
本文探讨了在可转向多元对齐中,如何利用多目标直接偏好优化(MODPO)来预测目标冲突并涵盖权衡,研究发现预训练测量能够预测人类标注数据的对齐,并提出了更广泛涵盖权衡的方法。
本文提出DiaWhisper-DPO,一个用于临床访谈转录和角色归因的端到端模型,采用失败挖掘的偏好优化,相比级联基线实现高准确度并减少错误。
本文提出了Style-Debiased DPO (SD-DPO),一种用于事实感知合成偏好数据的方法,旨在改善大型语言模型中的知识提取,解决标准DPO可能因风格差异而错误惩罚正确回答的问题。
StalePO引入了一种用于机器翻译的令牌级偏好优化方法,该方法利用传统后编辑来提升模型性能,在质量指标上显示出显著提升。
本文提出基于比较的偏好优化(ComPO),一种用于LLM的零阶对齐方法,利用比较预言机来避免似然位移。它包括理论保证和对现有方法的实验改进。
本文提出了一种面向网络代理的预算感知在线教学框架,能够在保持性能的同时降低教师模型调用和计算成本。
直接多样性优化(DDO)是一种离线后训练方法,它改进了用于序贯决策任务的大语言模型(LLM)代理的成功策略覆盖,并在基准测试(如BabyAI、BabaIsAI和WebShop)中优于其他方法。
Research from Stanford and Columbia shows that sycophantic agreement can emerge as an unintended consequence of contrastive preference optimization objectives, with teacher model bias transferring to student models even when preference data appears neutral across the dataset.
本文介绍了FiMI Banking,这是一个用于印度零售银行的自主对话AI模型,通过偏好优化和强化学习训练,以在监管约束内增强安全行为和工具使用性能。
CoMerge是一个基于冲突驱动的偏好优化框架,用于合并多任务LLMs,采用自监督策略来减轻参数干扰,并在如MergeBench等基准测试中实现高性能。
PLC-DPO通过使用策略参考边际将噪声偏好标签路由到干净、翻转或平局案例中,增强了直接偏好优化,从而在各种基准测试中提高了性能。
本文提出了MoPLEx算法,用于学习Plackett-Luce模型的混合体以处理AI对齐中的异构偏好,相比基线方法展示了聚类和排序准确率的提升。
本文提出Step-KTOder,这是一个用于代码偏好优化的框架,它使用函数级执行反馈与单元测试相结合,在HumanEval+和MBPP+等基准测试上优于仅基于结果的方法(如KTO和DPO)。
跨语言排序偏好优化(CRPO)是一种新框架,通过层级排序优化将英语偏好知识转移到目标语言,从而增强多语言LLM的对齐,并在多种语言中展示出在指令遵循和知识利用方面的性能提升。
FAR-DPO 是一个可行性感知且稳健的直接偏好优化框架,通过使生成模型与结构和生物物理约束对齐,增强药物发现中的环肽设计,提高 PepGLAD 和 PepFlow 等基准测试的成功率。
本文将流形漂移确定为流偏好优化中奖励黑客攻击的根本原因,并介绍了ThermoDPO,一种温度控制的方法,该方法将优化锚定在偏好样本上,以保持数据流形的完整性并提高性能。
Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。
本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。
该论文提出了MAP-PO,一个多智能体框架,通过标注行为对标注者进行聚类,并使用偏好优化为每个聚类微调独立的LLM智能体,从而在性别歧视检测任务中保留分歧。在EXIST 2024数据集上的实验表明,聚类特定训练是必要的,且共享的团队级奖励能使智能体保持校准。
Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。