标签
论文提出了在线策略逆蒸馏(OPRD)方法,该方法通过沿教师策略偏移方向放大验证器支持的策略梯度,使更强的AI模型能够超越较弱的监督者,在蒸馏场景中以更少的更新次数获得更高性能。
CritICL 是一个推理时框架,它利用来自较小模型的结构化失败模式作为批判性指导来增强大型语言模型的推理能力,其性能优于标准上下文学习,并降低了生成和令牌成本。
信任函数通过识别可靠的弱标签进行训练,实现近乎无损的弱到强泛化,在多个领域中达到与真实标签监督相当的性能。