标签
本文研究了LLM后训练中如何选择需要标注的完成对以供人类偏好反馈的问题。它将比较筛选问题形式化为采样设计问题,给出了DPO策略最优性差距的理论上界,并提出了实用的采样设计方案,在合成和真实基准测试上比常规启发式方法更有效地提高了样本效率。