标签
提出可靠性引导的偏好优化(RGPO)方法,通过估计标注者可靠性并基于共识动态调整训练,处理LLM对齐中的不一致人类反馈,性能优于标准RLHF方法。
提出了部分裁决的基于设计的监督学习(PA-DSL)方法,该方法利用少量已裁决案例纠正噪声人工标签,从而消除自动化分类器的偏差,在实验中实现了名义覆盖度,并将均方根误差(RMSE)降低了10-17%。
本文针对噪声偏好标签下的直接偏好优化,提出了一种双层优化框架,引入了一种无元数据的元加权方法,该方法使用中心差分近似和LoRA微调来提高对齐性能。
MOLAR提出了一种噪声感知框架,通过将干净属性推理与观测到的标签噪声分离,从噪声标签中学习多模态分子表征,在分子基准测试中优于基线方法。
本文研究了标签噪声下鲁棒训练的损失函数对称化,提出了SGCE和alpha-MAE两种损失函数,它们在多类无铰链损失和平均绝对误差之间插值,具有理论保证和有竞争力的实证表现。