标签
本文提供了为什么pass@k的最佳采样温度随预算增加而上升的理论解释,推导了充分条件,并在没有模型训练或查询的情况下分析了经验模式。
本文识别了当前评估AI编码代理基准测试中的关键缺陷,例如对pass@k指标的误用,并提出了新的指标,如reliability@k和security-adjusted reliability@k,以改进对可靠性和安全性的衡量。
本文研究了推理模型在监督微调过程中失去覆盖率的原因,将这一现象与训练数据中存在多个有效路径的决策点联系起来,并提出数据合成和多样性感知解码作为缓解措施。