标签
本文研究偏好优化如何塑造LLM咨询师在动机性访谈中的行为,发现惩罚对抗行为会以目标坚持为代价换取关系协调,而不是教会平衡的“顺应阻力”技能。
Presents TELLER, a dual-path iterative preference optimization approach for table entity linking, with direct-answer and reasoning paths that improve accuracy on TableInstruct and MammoTab V2 benchmarks.
LARA 是一种高效适应方法,它向冻结模型的残差流添加低秩修正,而不是修改权重,在匹配 LoRA 性能的同时实现可组合行为和推理时调控。
本文介绍了DMAPO,一种偏好优化方法,利用多评估者共识来选取高置信度的在策略响应,以显著更少的数据(仅3.45%的接受率)实现强对齐,并在多个基准测试中优于SimPO等基线。
本文证明,预训练的最终窗口显著影响模型对后训练对齐的响应,即使SFT性能完全相同也是如此,这表明检查点评估应包含最后训练的数据。
提出可靠性引导的偏好优化(RGPO)方法,通过估计标注者可靠性并基于共识动态调整训练,处理LLM对齐中的不一致人类反馈,性能优于标准RLHF方法。
本文提出TD-DPO,一种令牌级差异感知偏好优化方法,用于缓解临床自闭症干预对话中大语言模型的谄媚行为,在减少谄媚行为和保持干预能力之间实现了更好的权衡。
本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。
本文提出了RIMS,一种面向小规模语言模型在检索增强生成中的三阶段偏好优化框架,利用合成思维链数据和可微软聚合机制来提高对噪声证据的鲁棒性。实验表明,在多跳问答基准上,该方法相较于基线持续取得改进。
介绍了SciForma,一个用于生成具有高结构保真度的科学方法图表的框架,使用多维联合偏好优化(M-DPO)和结构清单来确保在组件、箭头和文本轴上的正确性。该9B模型在基准评估上超越了开源基线和GPT-Image-1.5。
本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。
D2PO提出了一种动态偏好优化框架,利用直接偏好优化使扩散采样策略与感知质量对齐,在低NFE约束下优于基于回归的方法。
这篇文章解释了推理模型中的“末日循环”,即模型重复诸如“Wait”之类的令牌,直到上下文填满,并介绍了FTPO(最终令牌偏好优化)作为训练时的修复方法。相关的Antidoom工具显著降低了末日循环率(例如,在Qwen3.5-4B上从22.9%降至1%)。
KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。
本文提出一种用于LLM对齐的分布鲁棒列表级偏好优化方法,处理排序标签不确定性,具有可处理的目标函数和强收敛性保证。
提出MI-EPO,一种基于信息理论的多目标对齐框架,用于大型语言模型,通过互信息增强探索,确保生成的响应可区分且与不同偏好向量对齐,在冲突目标间实现稳定权衡。
CAT 引入了一个框架,利用模型自身置信信号,根据问题难度自主调整推理长度,减少过度思考,提高大型推理模型的推理效率。
一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。
本文研究了LLM后训练中如何选择需要标注的完成对以供人类偏好反馈的问题。它将比较筛选问题形式化为采样设计问题,给出了DPO策略最优性差距的理论上界,并提出了实用的采样设计方案,在合成和真实基准测试上比常规启发式方法更有效地提高了样本效率。
PolyAlign是一个分布感知的对齐框架,它将语言模型对齐到特定上下文的人类回复分布,而不是单一的全局风格,从而提升了双语环境下的自然性和忠实度。