标签
介绍了 Sys1Cal-v1 数据集,用于评估 AI 模型的概率校准,表明像 Jev 这样的模型可能在二进制输出中抑制不确定性。
RLCD被解释为一种基于模式的Plackett–Luce目标函数,它推进了奖励建模从标量奖励到成对偏好再到多路校准决策,简化了对Jev的理解。
本文首次研究了概率校准作为缓解LLM代理反馈循环中评估者偏好耦合的方法,结果表明校准后的评估者判断将耦合系数降低了20-49%,散度降低了45-67%。
介绍Simplex约束的稀疏Bagging (SCSB),一种训练后框架,利用袋外样本在概率单纯形上优化估计器权重,实现高达96%的集成压缩并改进校准。