preference-optimization

标签

Cards List
#preference-optimization

哪些目标需要调节?在可转向多元对齐中预测目标冲突与涵盖权衡

arXiv cs.AI ↗ · 17小时前 缓存

本文探讨了在可转向多元对齐中,如何利用多目标直接偏好优化(MODPO)来预测目标冲突并涵盖权衡,研究发现预训练测量能够预测人类标注数据的对齐,并提出了更广泛涵盖权衡的方法。

0 人收藏 0 人点赞
#preference-optimization

DiaWhisper-DPO:通过失败挖掘的偏好优化实现临床访谈的角色归因转录

arXiv cs.CL ↗ · 2026-09-16 缓存

本文提出DiaWhisper-DPO,一个用于临床访谈转录和角色归因的端到端模型,采用失败挖掘的偏好优化,相比级联基线实现高准确度并减少错误。

0 人收藏 0 人点赞
#preference-optimization

Style-Debiased DPO:使用事实感知合成偏好数据更新大型语言模型知识

arXiv cs.CL ↗ · 2026-09-16 缓存

本文提出了Style-Debiased DPO (SD-DPO),一种用于事实感知合成偏好数据的方法,旨在改善大型语言模型中的知识提取,解决标准DPO可能因风格差异而错误惩罚正确回答的问题。

0 人收藏 0 人点赞
#preference-optimization

StalePO:利用传统后编辑的机器翻译锚定令牌级偏好优化

arXiv cs.CL ↗ · 2026-09-16 缓存

StalePO引入了一种用于机器翻译的令牌级偏好优化方法,该方法利用传统后编辑来提升模型性能,在质量指标上显示出显著提升。

0 人收藏 0 人点赞
#preference-optimization

LLM 偏好对齐的零阶范式

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文提出基于比较的偏好优化(ComPO),一种用于LLM的零阶对齐方法,利用比较预言机来避免似然位移。它包括理论保证和对现有方法的实验改进。

0 人收藏 0 人点赞
#preference-optimization

何时与何事教学:面向网络代理的预算感知在线适应

arXiv cs.AI ↗ · 2026-09-10 缓存

本文提出了一种面向网络代理的预算感知在线教学框架,能够在保持性能的同时降低教师模型调用和计算成本。

0 人收藏 0 人点赞
#preference-optimization

偏好后训练中多样成功轨迹的直接多样性优化

arXiv cs.CL ↗ · 2026-09-10 缓存

直接多样性优化(DDO)是一种离线后训练方法,它改进了用于序贯决策任务的大语言模型(LLM)代理的成功策略覆盖,并在基准测试(如BabyAI、BabaIsAI和WebShop)中优于其他方法。

0 人收藏 0 人点赞
#preference-optimization

@Memoirs: Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization Camila Blank, Zhuofan Ying, C…

X AI KOLs Following ↗ · 2026-09-04 缓存

Research from Stanford and Columbia shows that sycophantic agreement can emerge as an unintended consequence of contrastive preference optimization objectives, with teacher model bias transferring to student models even when preference data appears neutral across the dataset.

0 人收藏 0 人点赞
#preference-optimization

FiMI Banking: 印度零售银行的自主模型

arXiv cs.AI ↗ · 2026-09-04 缓存

本文介绍了FiMI Banking,这是一个用于印度零售银行的自主对话AI模型,通过偏好优化和强化学习训练,以在监管约束内增强安全行为和工具使用性能。

0 人收藏 0 人点赞
#preference-optimization

CoMerge:基于冲突驱动的偏好优化方法用于多任务模型合并

arXiv cs.AI ↗ · 2026-09-03 缓存

CoMerge是一个基于冲突驱动的偏好优化框架,用于合并多任务LLMs,采用自监督策略来减轻参数干扰,并在如MergeBench等基准测试中实现高性能。

0 人收藏 0 人点赞
#preference-optimization

PLC-DPO:在噪声和模糊偏好优化中的后验标签校正

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

PLC-DPO通过使用策略参考边际将噪声偏好标签路由到干净、翻转或平局案例中,增强了直接偏好优化,从而在各种基准测试中提高了性能。

0 人收藏 0 人点赞
#preference-optimization

学习Plackett-Luce模型的混合体用于多目标对齐

arXiv cs.LG ↗ · 2026-08-27 缓存

本文提出了MoPLEx算法,用于学习Plackett-Luce模型的混合体以处理AI对齐中的异构偏好,相比基线方法展示了聚类和排序准确率的提升。

0 人收藏 0 人点赞
#preference-optimization

代码偏好优化的函数级执行反馈

arXiv cs.AI ↗ · 2026-08-26 缓存

本文提出Step-KTOder,这是一个用于代码偏好优化的框架,它使用函数级执行反馈与单元测试相结合,在HumanEval+和MBPP+等基准测试上优于仅基于结果的方法(如KTO和DPO)。

0 人收藏 0 人点赞
#preference-optimization

对齐中的语言链:跨语言排序偏好优化

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

跨语言排序偏好优化(CRPO)是一种新框架,通过层级排序优化将英语偏好知识转移到目标语言,从而增强多语言LLM的对齐,并在多种语言中展示出在指令遵循和知识利用方面的性能提升。

0 人收藏 0 人点赞
#preference-optimization

FAR-DPO: 面向环肽设计的可行性感知与稳健直接偏好优化

arXiv cs.LG ↗ · 2026-08-21 缓存

FAR-DPO 是一个可行性感知且稳健的直接偏好优化框架,通过使生成模型与结构和生物物理约束对齐,增强药物发现中的环肽设计,提高 PepGLAD 和 PepFlow 等基准测试的成功率。

0 人收藏 0 人点赞
#preference-optimization

流偏好优化中的流形漂移:奖励黑客攻击的根本原因

arXiv cs.AI ↗ · 2026-08-21 缓存

本文将流形漂移确定为流偏好优化中奖励黑客攻击的根本原因,并介绍了ThermoDPO,一种温度控制的方法,该方法将优化锚定在偏好样本上,以保持数据流形的完整性并提高性能。

0 人收藏 0 人点赞
#preference-optimization

Data-DPO: 用于LLM后训练中目标模型数据选择的直接偏好优化

arXiv cs.LG ↗ · 2026-08-19 缓存

Data-DPO是一种面向目标模型的LLM监督微调数据选择方法,通过单步探测学习数据偏好,并结合质量分数和多样性,在Vision-Flan和LLaVA-CoT数据集上超越了基线方法。

0 人收藏 0 人点赞
#preference-optimization

强化步骤级推理以实现LLM中的有效自我纠正

arXiv cs.CL ↗ · 2026-08-13 缓存

本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。

0 人收藏 0 人点赞
#preference-optimization

用多智能体视角偏好优化学习性别歧视检测

arXiv cs.CL ↗ · 2026-08-06 缓存

该论文提出了MAP-PO,一个多智能体框架,通过标注行为对标注者进行聚类,并使用偏好优化为每个聚类微调独立的LLM智能体,从而在性别歧视检测任务中保留分歧。在EXIST 2024数据集上的实验表明,聚类特定训练是必要的,且共享的团队级奖励能使智能体保持校准。

0 人收藏 0 人点赞
#preference-optimization

Show HN:在 4 GB 笔记本 GPU 上微调 8B 模型

Hacker News Top ↗ · 2026-08-04 缓存

Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈