标签
本文提供了为什么pass@k的最佳采样温度随预算增加而上升的理论解释,推导了充分条件,并在没有模型训练或查询的情况下分析了经验模式。
本文提出AUF(接受直到失败),这是一种针对推测解码中掩码块草稿模型的交叉熵损失的简单修改,它将监督限制到第一个预测失败之前的词缀,在不改变推理的情况下提升了多个基准测试的平均生成长度。