标签
本文介绍了语义步骤预测,该方法在推理步骤边界而非随机令牌位置上应用几何正则化,在ProcessBench上相比固定基线实现了168倍的多步潜在预测提升。
本文研究了最终Token安全探针在越狱提示上的失败,发现有害内容可以分布在较早的Token中,并被最终读取忽略。它提出了一种PCA-HMM轨迹模型作为诊断工具,该模型能够恢复许多遗漏,而不会产生简单Token池化的误报。