标签
本文诊断了内容生成中AI偏好与真实用户参与之间的系统性差距,发现大语言模型过度强调逻辑结构,而真实参与更倾向于情感和表达元素,并提出OMRA来将这一差距缩小54.4%。
这篇arXiv论文研究了测量的AI偏好中,有多少归因于模型本身,有多少归因于用于评估的测试工具。