reward-mechanism

标签

Cards List
#reward-mechanism

让每次工具调用都发挥价值:面向代理视觉-语言模型的必要工具-证据路径奖励

arXiv cs.AI · 2026-09-04 缓存

本文介绍了一种新颖的监督机制NTEP-R,它通过奖励代理视觉-语言模型进行必要的工具调用并提取相关证据,从而提高复杂查询的效率和准确性。

0 人收藏 0 人点赞
#reward-mechanism

通过基于强化学习的微调缓解LLM谄媚:贝叶斯真相血清方法

arXiv cs.LG · 2026-08-27 缓存

本文提出将贝叶斯真相血清作为强化学习微调中的奖励,以缓解大型语言模型的谄媚问题,显示在无标签数据的情况下,准确率提高且答案翻转率降低。

0 人收藏 0 人点赞
#reward-mechanism

InfoMem: 使用答案条件信息增益训练长上下文记忆代理

arXiv cs.AI · 2026-06-03 缓存

InfoMem 引入了一种用于训练分块记忆代理的奖励机制,该机制使用答案条件信息增益评估最终记忆的效用,在同一强化学习框架下提升了长上下文记忆代理的性能。

0 人收藏 0 人点赞
#reward-mechanism

超越数学和代码的可验证奖励:面向事实问答的轻量级语料库锚定过程监督

Hugging Face Daily Papers · 2026-05-28 缓存

CorVer是一种轻量级的、基于语料库的奖励机制,利用维基百科共现统计信息为事实问答中的强化学习提供高效的句子级反馈,其性能优于神经验证器,同时训练速度提升4.8至8.4倍。

0 人收藏 0 人点赞
#reward-mechanism

Geo-Align: 基于度量几何奖励的视频生成对齐

Hugging Face Daily Papers · 2026-05-22 缓存

Geo-Align 提出了一个用于相机可控视频重新渲染的强化学习框架,通过尺度感知的感知奖励和用于相机轨迹提取的度量三维估计来提高泛化能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈