标签
本文介绍了一种新颖的监督机制NTEP-R,它通过奖励代理视觉-语言模型进行必要的工具调用并提取相关证据,从而提高复杂查询的效率和准确性。
本文提出将贝叶斯真相血清作为强化学习微调中的奖励,以缓解大型语言模型的谄媚问题,显示在无标签数据的情况下,准确率提高且答案翻转率降低。
InfoMem 引入了一种用于训练分块记忆代理的奖励机制,该机制使用答案条件信息增益评估最终记忆的效用,在同一强化学习框架下提升了长上下文记忆代理的性能。
CorVer是一种轻量级的、基于语料库的奖励机制,利用维基百科共现统计信息为事实问答中的强化学习提供高效的句子级反馈,其性能优于神经验证器,同时训练速度提升4.8至8.4倍。
Geo-Align 提出了一个用于相机可控视频重新渲染的强化学习框架,通过尺度感知的感知奖励和用于相机轨迹提取的度量三维估计来提高泛化能力。