标签
本文发现,上下文中的先前审计和修复事件通过转移决策阈值来减少LLM验证器的误报,其中修复内容和审计结果对不同的模型家族产生互补影响。
本文介绍了验证器诱导的支持重塑,表明具有可验证奖励的同策略强化学习能够在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样。跨数学推理和指令跟随的实验表明,端点改进并不能保证未来的可训练性。
作者讨论AI在严肃行业落地中缺乏中间表示(IR)和验证器(Verifier)的问题,以text-to-CAD为例说明统一IR和验证对AI方案可行性的关键作用。
本文介绍了VGB,一种带有概率回溯的过程引导采样算法,通过鲁棒地处理验证器错误,显著提升了小型0.5B模型的编码性能。
符号门控在线策略蒸馏(SG-OPD)通过使用二元验证器作为教师监督的信任信号,增强了标准在线策略蒸馏,在竞赛级数学推理基准上提升了性能。
本文研究了以验证器为后盾的委员会搜索作为推理语言模型的推理时增强方法,表明在像 SWE-bench Verified 这样的代码修复任务上,弱推理模型委员会可以匹配强得多的模型的性能。
介绍了 LoVer,一种使用逻辑规则(否定一致性、组内一致性和组间一致性)来在无标签数据下提升大语言模型推理能力的无监督验证器,在推理基准测试中达到了接近监督验证器的性能。