video-reward-modeling

标签

Cards List
#video-reward-modeling

先思考,再打分:解耦推理与打分的视频奖励建模

Hugging Face Daily Papers ↗ · 2026-05-07 缓存

本文介绍了 DeScore,这是一种通过解耦推理和打分过程来提高训练效率和泛化能力的视频奖励模型。它利用多模态大语言模型采用“先思考再打分”的范式,解决了现有判别式和生成式奖励模型的局限性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈