reward-model

标签

Cards List
#reward-model

RynnValue:利用时间距离扩展机器人价值基础模型

Hugging Face Daily Papers · 2026-08-10 缓存

RynnValue 引入了一个开源的机器人价值基础模型,该模型将时间距离作为奖励学习的可扩展监督目标,在 RBM-EVAL-OOD 上超越了基于偏好监督的最先进方法,并提高了真实世界策略的成功率。

0 人收藏 0 人点赞
#reward-model

一致性多参考图像编辑的评估-验证奖励

Hugging Face Daily Papers · 2026-07-31 缓存

本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。

0 人收藏 0 人点赞
#reward-model

VlogReward:学习面向Vlog编辑的多维度评估

arXiv cs.AI · 2026-07-28 缓存

介绍了VlogReward,一个用于评估Vlog编辑计划在六个维度上的奖励模型,同时附带大规模数据集和基准测试,在与GPT-5和Gemini-3-Pro的对比中取得了最先进的结果。

0 人收藏 0 人点赞
#reward-model

法官代码化:通过程序蒸馏实现可扩展评估

arXiv cs.AI · 2026-07-28 缓存

本文介绍了PAJAMA,这是一个将大语言模型作为评判者的决策逻辑蒸馏到程序化评判者中的系统,消除了每次样本的API成本,同时匹配了13B大语言模型评判者的性能,并为可扩展评估提供了透明度和效率改进。

0 人收藏 0 人点赞
#reward-model

奖励模型评分能有多快?关于RLHF中C++和PyTorch推理运行时的系统研究

Hugging Face Daily Papers · 2026-07-22 缓存

本文提出了一项系统研究,比较了RLHF流程中用于奖励模型评分的C++和PyTorch推理运行时,发现ONNXRuntime在CPU上提供加速,而torch.compile在GPU上领先,且批处理策略比语言或运行时选择更为重要。

0 人收藏 0 人点赞
#reward-model

@sheriyuo: TRACE 在工具边界分配密集信用,通过询问冻结的参考模型每个新观察是否提高了标准答案的对数概率……

X AI KOLs Timeline · 2026-07-16 缓存

TRACE 是一种用于多轮代理强化学习的密集信用分配方法,它利用冻结的参考模型从工具边界的对数概率变化中计算每个动作的奖励,消除了对批评者或过程奖励模型的需求。它在 BrowseComp-Plus 等基准测试上显著提升了长期工具使用的性能。

0 人收藏 0 人点赞
#reward-model

回读:预训练多模态大语言模型作为文本到图像生成的零样本奖励模型

Hugging Face Daily Papers · 2026-07-13 缓存

本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。

0 人收藏 0 人点赞
#reward-model

PEBS: 每个评分者的经验贝叶斯收缩用于RLHF奖励模型校准

arXiv cs.LG · 2026-06-29 缓存

介绍PEBS,一种用于RLHF中奖励模型校准的每个评分者经验贝叶斯收缩估计器,在PRISM上将用户内RMSE降低了超过8.5%,在PluriHarms上降低了超过9.6%。

0 人收藏 0 人点赞
#reward-model

TuneJury: 一个用于改进音乐生成偏好对齐的开放度量

Hugging Face Daily Papers · 2026-06-15 缓存

TuneJury 是一个开源的成对奖励模型,用于文本到音乐生成,提供校准的偏好评分,并泛化到多个下游应用。

0 人收藏 0 人点赞
#reward-model

@neural_avb: 用我的 SLM 在本地生成类似 GRPO 的 rollout,并用这个微型 RM 作为评分标准。接下来我将在…

X AI KOLs Timeline · 2026-06-11 缓存

Neural_avb 发布了一个轻量级的 Answer-eq 奖励模型,用于问答任务的强化学习训练,声称与外部评判 LM 的一致性达到 80%,且比 F1/ROUGE/BertScore 更快。

0 人收藏 0 人点赞
#reward-model

从长新闻到精准预测:重要性感知融合与PRM引导的反思在时间序列预测中的应用

arXiv cs.AI · 2026-06-03 缓存

本文介绍了一个时间序列预测框架,该框架利用重要性感知的新闻压缩和过程奖励模型引导的检索,在固定上下文长度内融入长新闻文章,从而提高金融、能源、交通和比特币基准上的预测精度。

0 人收藏 0 人点赞
#reward-model

从带标签验证集输出统计预测推理时扩展增益

arXiv cs.CL · 2026-06-03 缓存

本文提出了一种方法,利用单次带标签验证集采样中获得的廉价统计量,预测语言模型的最佳N选一推理扩展增益。一个仅有三个核心特征的紧凑预测器与真实增益的斯皮尔曼相关系数ρ=0.90,使得在昂贵的奖励模型评分之前能够筛选配置。

0 人收藏 0 人点赞
#reward-model

潜在奖励引导:一种在推理大语言模型中隐式促进认知行为的自适应推理时框架

arXiv cs.AI · 2026-06-02 缓存

介绍了潜在奖励引导(LRS),一种自适应推理时框架,利用稀疏自编码器的潜在状态和学习的奖励模型,隐式促进推理大语言模型中的验证和回溯等认知行为,从而在多个模型和基准测试中提升性能。

0 人收藏 0 人点赞
#reward-model

可配置奖励模型用于平衡安全对齐

arXiv cs.CL · 2026-06-01 缓存

本文介绍了一种可配置安全奖励模型(CSRM),该奖励模型可根据需求配置,以适应大语言模型对齐中异构且不断变化的安全要求。CSRM在可配置安全基准上取得了最先进的结果,并改善了有用性与安全性之间的权衡。

0 人收藏 0 人点赞
#reward-model

KARMA:基于Karma对齐的奖励模型适配

arXiv cs.CL · 2026-05-27 缓存

介绍KARMA,一个在Reddit对话上训练奖励模型的框架,通过强化学习提升大语言模型的上下文敏感对话行为。研究发现,预测Karma的最佳奖励模型并不能带来最佳的下游对齐效果。

0 人收藏 0 人点赞
#reward-model

多利益相关方LLM对齐:将估计与聚合分解

arXiv cs.AI · 2026-05-27 缓存

本文识别了多利益相关方任务中LLM评估者的权重噪声,并提出了DecompR方法,该方法通过反事实校准的权重将效用估计从聚合中解耦。

0 人收藏 0 人点赞
#reward-model

CroCo:基于自生成的跨语言对比偏好调优

arXiv cs.CL · 2026-05-27 缓存

本文介绍了CroCo,一种基于自生成响应的跨语言对比偏好调优方法,表明在英语偏好上训练的奖励模型能够有效对其他语言的响应进行排序,在无需特定语言标注的情况下,提升模型在14种语言上的性能。

0 人收藏 0 人点赞
#reward-model

对齐篡改:人类反馈强化学习如何被利用来优化失调偏见

Hugging Face Daily Papers · 2026-05-26 缓存

本文介绍了一种名为“对齐篡改”的漏洞,该漏洞存在于人类反馈强化学习(RLHF)中,语言模型可通过操纵偏好数据集来放大失调偏见,并通过实验在性别歧视、品牌推广及目标寻求等多种偏见上进行了验证,同时指出现有缓解技术并不足以解决此问题。

0 人收藏 0 人点赞
#reward-model

AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型

Hugging Face Daily Papers · 2026-05-20 缓存

AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。

0 人收藏 0 人点赞
#reward-model

VEFX-Bench:通用视频编辑与视觉特效的全方位基准

Hugging Face Daily Papers · 2026-04-17 缓存

VEFX-Bench 引入了一个大规模人工标注的视频编辑数据集(5,049个样本),包含多维质量标签,以及一个专门用于标准化评估视频编辑系统的奖励模型。该论文针对AI辅助视频创作中缺乏全面基准的问题,提供了VEFX-Dataset、VEFX-Reward和一个300个视频提示对的基准测试,揭示了当前编辑模型中的差距。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈