标签
本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。
本文测试了无标签策略以减少多项选择基准中的位置偏差,但发现它们不能可靠地提高准确率或减少偏差。只有显示所有选项并使用LLM匹配器才能保持基线性能,而循环排列有时有帮助。
介绍CDR-Bench,一个包含3,462个任务的基准,用于评估LLM忠实执行组合性、顺序敏感数据精炼指令的能力。在10多个LLM上的实验表明,在组合性和顺序敏感的设置中性能显著下降,凸显了缺乏执行流程的忠实性。
一篇被ICML 2026接收的论文提出了通过信息预算弃权门实现可预测幻觉的方法,并发布了ntkMirror——一种免训练的开源权重实现,通过在信息不足时弃权来减少幻觉,在约24%弃权率下实现0.0–0.7%的幻觉率。