标签
本文揭示了幻觉检测中的“检测性差距”:幻觉可分为高一致性(Ghost)与低一致性(Flickering)两种模式,二者之间存在 0.35–0.46 的 AUC 差距。该差距在四个模型与三个事实问答数据集上持续存在,即使在固定模式归属并采用更严格的基于轨迹的测试后依然如此。作者指出,聚合层面的检测指标掩盖了模型相关的异质性,并呼吁采用基于模式条件的评估方法。
本文提出 LUDI,一种非均匀扩散语言建模框架,解决了均匀扩散语言模型中训练目标过度均匀以及条件与目标混淆的问题,实现了 7B 规模的均匀离散扩散语言模型(UDLM),在逐步处理速度上比自回归解码快 3 倍,同时在复杂推理任务上具备有竞争力的性能。