标签
本文提出了一种基于EM的算法,在Boltzmann理性模型下从成对比较中联合学习项目奖励和工人可靠性,利用Polya-Gamma潜在变量实现可处理的优化。实验表明,该方法在众包和奖励学习场景中对垃圾制造者和对抗性工人具有鲁棒性。
本文研究了基于噪声成对比较的固定置信度top-k识别问题,并开发了一种渐近最优算法,该算法最小化期望比较次数。
本文批判了使用成对比较来学习人类偏好的方法,认为内部多元主义(多种相互冲突的优先级)削弱了标准方法。它提出了一个形式化模型,并建议允许犹豫不决可以提高学习效率。