标签
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。
本文评估了临床医生的成对偏好能否可靠反映大语言模型(LLM)的临床安全性,使用了来自超过736名临床医生对13个模型的26,804条判断。研究发现,偏好排名与安全关键失败的相关性较弱,并提出了一种经临床调整的排名,能更好地纳入基于评分标准的安全性信号。
本文形式化了成对参考对齐作为模型级别的序数可观测变量,定义了一个统计量来衡量模型评分与参考偏好分布之间的一致性,并给出了有限样本估计量以及在Qwen2.5模型和RewardBench上的实证研究。