reward-modeling

标签

Cards List
#reward-modeling

LEMUR:从偏好反馈中学习与多目标强化学习对齐

arXiv cs.AI · 2026-08-03 缓存

本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。

0 人收藏 0 人点赞
#reward-modeling

DS@GT ARC 在 CheckThat! 2026:基于 LLM 的推理轨迹排序与分组奖励建模用于多语言数值声明验证

arXiv cs.CL · 2026-07-29 缓存

本文介绍了面向 CLEF 2026 CheckThat! 任务2 的系统,该系统利用基于 LLM 的推理轨迹排序和分组奖励建模来验证英语和阿拉伯语的数值声明,并比较了微调验证器与轻量级奖励模型。

0 人收藏 0 人点赞
#reward-modeling

面向机器人学习的进度奖励建模:综合综述

arXiv cs.CL · 2026-07-27 缓存

本综述为机器人学习的进度奖励建模提供了统一视角,将领域组织为三个步骤:接口、方法和数据/基准。

0 人收藏 0 人点赞
#reward-modeling

偏好优化的归一化奖励

arXiv cs.LG · 2026-07-21 缓存

本文引入了一种用于直接对齐算法(DAAs)的正则化技术,该技术保持归一化的响应概率,从而缓解过度优化和似然偏移。该方法提升了生成质量和基准性能,在AlpacaEval2上实现了超过20%的相对提升,并在Llama-3.1-8B-Instruct的通用基准上获得9%的性能增益。

0 人收藏 0 人点赞
#reward-modeling

RLHF偏好数据中的评估者状态偏差:一个审计框架

arXiv cs.AI · 2026-07-21 缓存

本文识别并形式化了RLHF偏好数据中的评估者状态偏差,即标注者的情绪状态可能混淆偏好标签。它提出了一个包含可证伪预测的审计框架来检测此类偏差。

0 人收藏 0 人点赞
#reward-modeling

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI · 2026-07-16 缓存

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。

0 人收藏 0 人点赞
#reward-modeling

通过渐进式代码切换实现高效的多语言推理迁移

arXiv cs.CL · 2026-07-02 缓存

本文提出渐进式代码切换(PCS),这是一种结合课程学习的强化学习方法,逐步增加LLM中的代码切换比例,从而实现多语言推理能力的高效迁移。

0 人收藏 0 人点赞
#reward-modeling

@gabepereyra: Harvey与@appliedcompute合作训练法律智能体。我们优化了智能体堆栈的每个部分,包括……

X AI KOLs Following · 2026-06-22 缓存

Harvey与Applied Compute合作训练了一个法律智能体,对智能体堆栈进行了优化,并使用来自其法律智能体基准(LAB)的奖励信号对GLM-5.1模型进行了后训练。

0 人收藏 0 人点赞
#reward-modeling

PAFO:面向个性化奖励建模的帕累托公平优化

arXiv cs.AI · 2026-06-09 缓存

本文提出PAFO,一种帕累托公平优化框架,用于缓解大语言模型奖励模型中的个性化奖励偏差,在不损害多数用户组的情况下提高少数用户组的准确性。

0 人收藏 0 人点赞
#reward-modeling

通过最差维度优化改进多模态推理

arXiv cs.AI · 2026-06-09 缓存

本文提出了多模态多维度标量化过程奖励建模(MMS-PRM),该方法在多模态推理中强制最差维度的鲁棒性,以防止视觉幻觉等失败被强大的文本逻辑掩盖。

0 人收藏 0 人点赞
#reward-modeling

超越评分准则:面向奖励建模的探索引导评估技能

arXiv cs.CL · 2026-06-08 缓存

Eval-Skill 是一种探索引导方法,可合成为奖励建模的可复用评估技能,在 RewardBench 2 上相比现有骨干模型取得了显著提升。

0 人收藏 0 人点赞
#reward-modeling

超越标量奖励:将推理内化到分数分布中

Hugging Face Daily Papers · 2026-06-08 缓存

Z-Reward 是一个教师-学生框架,它将复杂推理与高效的奖励部署解耦,用于文本到图像的训练。该框架使用 27B 教师模型达到了 89.6% 的人类偏好准确率,使用 9B 学生模型达到了 88.6%,超过了先前的方法。

0 人收藏 0 人点赞
#reward-modeling

BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解

arXiv cs.AI · 2026-06-04 缓存

BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。

0 人收藏 0 人点赞
#reward-modeling

Skill-RM: 通过智能体技能统一异构评估标准

Hugging Face Daily Papers · 2026-06-02 缓存

Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。

0 人收藏 0 人点赞
#reward-modeling

通过感知扰动与奖励建模缓解多模态LLM评判中的感知判断偏差

Hugging Face Daily Papers · 2026-06-01 缓存

本文识别出多模态LLM评判者存在的感知判断偏差,即它们倾向于过度奖励流畅但视觉错误的回答,并提出了数据集PPJD以及利用GRPO与批量排序奖励训练的模型Perception-Judge,以缓解此偏差并提升基于感知的评估质量。

0 人收藏 0 人点赞
#reward-modeling

RUBRIC-ARROW:非可验证领域中LLM后训练的交替点状评分标准奖励建模

Hugging Face Daily Papers · 2026-05-27 缓存

RUBRIC-ARROW 提出了一种交替式奖励建模框架,通过减少平局并利用成对偏好数据改进了基于评分标准的方法,在非可验证领域为LLM后训练实现了具有竞争力的准确率和收益。

0 人收藏 0 人点赞
#reward-modeling

传递性与循环性的相遇:面向动态大语言模型对齐的显式偏好分解

arXiv cs.CL · 2026-05-19 缓存

本文介绍了混合奖励循环(HRC)模型和动态自对弈偏好优化(DSPPO)方法,以解决大语言模型对齐中人类偏好的循环特性,在Bradley-Terry和通用偏好模型(GPM)基线上取得了更优的性能表现。

0 人收藏 0 人点赞
#reward-modeling

看不清还是想不对?面向视觉语言推理的感知奖励

arXiv cs.AI · 2026-05-15 缓存

本文提出一种强化学习框架,通过显式奖励感知保真度来改善视觉语言模型中的感知-推理协同,利用“蒙眼推理”代理和结构化言语验证来解决模态信用分配中的模糊性。

0 人收藏 0 人点赞
#reward-modeling

Edit-Compass & EditReward-Compass: 图像编辑与奖励建模的统一基准

Hugging Face Daily Papers · 2026-05-13 缓存

介绍了Edit-Compass和EditReward-Compass,这是一个用于评估图像编辑模型和奖励模型的统一基准套件,包含2,388个标注实例和2,251个偏好对,用于真实的强化学习场景。

0 人收藏 0 人点赞
#reward-modeling

RewardHarness:自演进的代理式后训练框架

arXiv cs.AI · 2026-05-12 缓存

RewardHarness 是一个用于后训练的自演进代理框架,通过迭代优化工具和技能库来替代大规模偏好标注,在图像编辑评估基准上的表现优于 GPT-5。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈