preference-optimization

标签

Cards List
#preference-optimization

顺应阻力:偏好优化的LLM咨询师在动机性访谈中可能以目标坚持换取关系协调

arXiv cs.CL ↗ · 2026-08-03 缓存

本文研究偏好优化如何塑造LLM咨询师在动机性访谈中的行为,发现惩罚对抗行为会以目标坚持为代价换取关系协调,而不是教会平衡的“顺应阻力”技能。

0 人收藏 0 人点赞
#preference-optimization

TELLER: Dual-Path Iterative Preference Optimization for Table Entity Linking

arXiv cs.CL ↗ · 2026-08-03 缓存

Presents TELLER, a dual-path iterative preference optimization approach for table entity linking, with direct-answer and reasoning paths that improve accuracy on TableInstruct and MammoTab V2 benchmarks.

0 人收藏 0 人点赞
#preference-optimization

LARA:残差流中的轻量级适配器,用于可组合的适应与对齐

arXiv cs.LG ↗ · 2026-08-03 缓存

LARA 是一种高效适应方法,它向冻结模型的残差流添加低秩修正,而不是修改权重,在匹配 LoRA 性能的同时实现可组合行为和推理时调控。

0 人收藏 0 人点赞
#preference-optimization

更少数据,更好对齐:数据驱动的多评估者一致性偏好优化

arXiv cs.AI ↗ · 2026-07-29 缓存

本文介绍了DMAPO,一种偏好优化方法,利用多评估者共识来选取高置信度的在策略响应,以显著更少的数据(仅3.45%的接受率)实现强对齐,并在多个基准测试中优于SimPO等基线。

0 人收藏 0 人点赞
#preference-optimization

相似模型学习方式不同:最终窗口预训练塑造超越SFT的后训练效果

arXiv cs.AI ↗ · 2026-07-29 缓存

本文证明,预训练的最终窗口显著影响模型对后训练对齐的响应,即使SFT性能完全相同也是如此,这表明检查点评估应包含最后训练的数据。

0 人收藏 0 人点赞
#preference-optimization

基于不一致人类反馈的可靠性感知LLM对齐

arXiv cs.AI ↗ · 2026-07-24 缓存

提出可靠性引导的偏好优化(RGPO)方法,通过估计标注者可靠性并基于共识动态调整训练,处理LLM对齐中的不一致人类反馈,性能优于标准RLHF方法。

0 人收藏 0 人点赞
#preference-optimization

TD-DPO: 差异感知偏好优化在临床自闭症干预对话中缓解谄媚行为

arXiv cs.LG ↗ · 2026-07-22 缓存

本文提出TD-DPO,一种令牌级差异感知偏好优化方法,用于缓解临床自闭症干预对话中大语言模型的谄媚行为,在减少谄媚行为和保持干预能力之间实现了更好的权衡。

0 人收藏 0 人点赞
#preference-optimization

偏好优化的归一化奖励

arXiv cs.LG ↗ · 2026-07-21 缓存

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

0 人收藏 0 人点赞
#preference-optimization

RIMS:通过平滑多对聚合进行偏好优化以用于小规模语言模型检索增强生成

arXiv cs.CL ↗ · 2026-07-21 缓存

本文提出了RIMS,一种面向小规模语言模型在检索增强生成中的三阶段偏好优化框架,利用合成思维链数据和可微软聚合机制来提高对噪声证据的鲁棒性。实验表明,在多跳问答基准上,该方法相较于基线持续取得改进。

0 人收藏 0 人点赞
#preference-optimization

SciForma:科学图表的结构忠实生成

Hugging Face Daily Papers ↗ · 2026-07-20 缓存

介绍了SciForma,一个用于生成具有高结构保真度的科学方法图表的框架,使用多维联合偏好优化(M-DPO)和结构清单来确保在组件、箭头和文本轴上的正确性。该9B模型在基准评估上超越了开源基线和GPT-Image-1.5。

0 人收藏 0 人点赞
#preference-optimization

噪声偏好标签下无元数据的元加权直接偏好优化

arXiv cs.LG ↗ · 2026-07-14 缓存

本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。

0 人收藏 0 人点赞
#preference-optimization

D2PO:通过动态偏好优化扩散采样器

arXiv cs.LG ↗ · 2026-07-09 缓存

D2PO提出了一种动态偏好优化框架,利用直接偏好优化使扩散采样策略与感知质量对齐,在低NFE约束下优于基于回归的方法。

0 人收藏 0 人点赞
#preference-optimization

@helloiamleonie:与@liquidai团队一起编写这些工程博客真是太有趣了!这是我们一直在做的:Reas…

X AI KOLs Following ↗ · 2026-07-07 缓存

这篇文章解释了推理模型中的“末日循环”,即模型重复诸如“Wait”之类的令牌,直到上下文填满,并介绍了FTPO(最终令牌偏好优化)作为训练时的修复方法。相关的Antidoom工具显著降低了末日循环率(例如,在Qwen3.5-4B上从22.9%降至1%)。

0 人收藏 0 人点赞
#preference-optimization

KARMA: 基于知识图谱的自动化推理实现与对齐

arXiv cs.CL ↗ · 2026-07-07 缓存

KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。

0 人收藏 0 人点赞
#preference-optimization

分布鲁棒的列表级偏好优化

arXiv cs.AI ↗ · 2026-07-03 缓存

本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。

0 人收藏 0 人点赞
#preference-optimization

基于互信息的多目标探索与偏好优化

arXiv cs.CL ↗ · 2026-07-03 缓存

提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。

0 人收藏 0 人点赞
#preference-optimization

CAT: 大型推理模型高效推理的置信自适应思考

arXiv cs.CL ↗ · 2026-07-02 缓存

CAT 引入了一个框架,利用模型自身置信信号,根据问题难度自主调整推理长度,减少过度思考,提高大型推理模型的推理效率。

0 人收藏 0 人点赞
#preference-optimization

@dair_ai: 来自谷歌的新研究。LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。

0 人收藏 0 人点赞
#preference-optimization

LLM后训练中应比较哪些配对?

arXiv cs.AI ↗ · 2026-06-20 缓存

本文研究了LLM后训练中如何选择需要标注的完成对以供人类偏好反馈的问题。它将比较筛选问题形式化为采样设计问题,给出了DPO策略最优性差距的理论上界,并提出了实用的采样设计方案,在合成和真实基准测试上比常规启发式方法更有效地提高了样本效率。

0 人收藏 0 人点赞
#preference-optimization

PolyAlign: 条件化人类分布对齐

arXiv cs.CL ↗ · 2026-06-12 缓存

PolyAlign是一个分布感知的对齐框架,它将语言模型对齐到特定上下文的人类回复分布,而不是单一的全局风格,从而提升了双语环境下的自然性和忠实度。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈