标签
Edu-QuRating 提出了一种多维度教育数据评分的流水线,使用 LLM 判断来创建可复用的评分器,以提升语言模型预训练和后训练性能。
本文介绍了Markov decision contest,这是一种用于基于成对偏好的强化学习的新问题模型。它证明了平稳策略的最优性保证、在P中的精确可解性,并提出了一种高效学习的近似算法。