标签
onPanda是一个交互式工具,使用令牌级修正来高效标注大语言模型对齐数据和智能体轨迹,将中位数标注时间减少了52%。
本文介绍了MoDA,一种在线后训练强化学习算法,它共同提升大型语言模型的质量和多样性,以缓解模式崩溃,无需手工制作的人设或架构修改。
本研究引入GAPA数据集,以证明外貌描述常携带性别关联,而LLMs与人类评分存在系统性错位,挑战了性别中立沟通的假设。
本文提出基于比较的偏好优化(ComPO),一种用于LLM的零阶对齐方法,利用比较预言机来避免似然位移。它包括理论保证和对现有方法的实验改进。
文章讨论了大语言模型幻觉的公共基准测试如何推动快速改进,并探讨了对对齐的启示,强调需要透明度和诚实度的基准测试。
本文提出了一种溢出感知的多值激活引导方法,以实现LLMs的多元对齐,无需微调或奖励模型即可改进对多个价值维度的控制。
IDEEA提出了一种免训练的、依赖于输入的引导方法,适用于大型语言模型,通过对激活进行聚类并使用最优匹配,在TruthfulQA上比基线提升真实性高达23.5%。
本文提出Step-KTOder,这是一个用于代码偏好优化的框架,它使用函数级执行反馈与单元测试相结合,在HumanEval+和MBPP+等基准测试上优于仅基于结果的方法(如KTO和DPO)。
本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。
本文介绍了群体对齐诱发的谄媚行为(GAS),这是一个双侧评估框架,用于在将大语言模型与人口统计群体对齐时,同时衡量意见对齐的预期增益和谄媚行为的非预期变化,并发现这些效应是非均匀且具有群体特异性的。
The paper introduces Evaluation-Conditioned Training (ECT), a post-training framework that conditions on natural language descriptions of feedback fidelity to help LLMs generalize to stronger oversight, with proof-of-concept experiments showing improved even-handedness and reduced sycophancy.
本文提出了MCF-CVA,一种用于大型语言模型情境价值对齐的多层组合融合框架,该框架利用多个道德智能体以及扩展-约简过程来更好地捕捉伦理多元主义,并优于单智能体基线方法。
本文提出了贡献对比(CoCo),一种新颖的响应级解释方法,用于混合专家奖励模型,相比基于路由权重的方法,能更忠实地捕捉路由和偏好行为。
SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.
提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。
This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.
MeRLa 是一个用于 RLHF 的元学习奖励塑造框架,通过学习任务特定的塑造函数来改善对齐,在多个基准上取得了最先进的结果,并显著降低了训练不稳定性。
本文介绍了DMAPO,一种偏好优化方法,利用多评估者共识来选取高置信度的在策略响应,以显著更少的数据(仅3.45%的接受率)实现强对齐,并在多个基准测试中优于SimPO等基线。
介绍SyRuP,一种解码时框架,它训练一个交叉注意力奖励头来为系统提示生成令牌级别的遵从分数,无需模型调优即可提高大语言模型对复杂提示的遵从性。
介绍了一种可扩展的、仅需推理的数据估值管线,该管线通过近似Shapley值来审计LLM对齐数据集,将手动审计搜索空间减少了99.1%,并揭示了HelpSteer2和HH-RLHF中隐藏的标签错误。