@mosh_levy: 新论文!人们将推理轨迹视为文本,但如果我们能做得更好呢?我们证明我们可以,通过…
摘要
介绍了行为预测器(BFs),它以推理轨迹为输入,并以极低的成本实现比前沿模型更准确的预测。
查看缓存全文
缓存时间: 2026/06/12 04:52
新论文! 人们把推理轨迹当作文本对待,但如果我们能做得更好呢? 我们证明这是可行的——通过训练行为预测器(BFs),将推理轨迹作为输入,就能以前沿模型几分之一的成本做出更准确的预测。
预测模型行为的常规方法是先解释其计算过程,再基于解释进行推理。 我们跳过了解释步骤,直接将预测视为一个学习问题。
我们训练BFs基于单条轨迹预测行为。 从待预测的目标模型初始化BFs,加上一个小型预测头,端到端训练它们预测未来行为的属性。 只需通过查询目标模型就能获得标注训练数据。
我们将该方法应用于预测两类行为属性: 重跑时是否会给出相同答案(重跑一致性), 以及输入的哪些部分导致了该答案(反事实敏感性)。
BFs超越了阅读相同轨迹的前沿模型。 它们的成本也低得多:只需一次前向传播即可获得预测,而体积大得多的前沿模型需要在其自身推理轨迹中生成数千个token。
我们还发现,BFs只需少量调优就能泛化到新数据集,甚至能胜任标记模型是否依赖所给提示的任务——这是检验推理是否忠实的一个常见测试。
关键点:推理轨迹携带了超越文本阅读所能传达的未来行为信号。 我们建议将轨迹视为可学习模式的数据,而非待阅读的文本。 该工作是与@yoavgo和@AsaCoopStick合作完成的。 https://arxiv.org/pdf/2606.11445
相似文章
将预测未来行为作为一项学习任务
本文提出训练行为预测器,从单条推理轨迹预测大型推理模型的输出,在计算成本更低的情况下优于GPT-5.4和Claude Opus-4.6等大型语言模型,绕过了传统的可解释性方法。
将未来行为预测作为学习任务
本文提出了 Behavior Forecasters,一种从推理轨迹中预测 LRM 未来行为(如答案一致性和输入敏感性)的学习方法,以更低的成本超越了 GPT-5.4 和 Claude Opus 4.6。
语义步骤预测:通过步骤采样实现LLM推理轨迹中的多步潜在预测
本文介绍了语义步骤预测,该方法在推理步骤边界而非随机令牌位置上应用几何正则化,在ProcessBench上相比固定基线实现了168倍的多步潜在预测提升。
推理模型并非只是思考更久,其运作轨迹也不同
本文通过分析代码、数学和SAT领域中的隐藏状态轨迹几何特征,探究经推理训练的语言模型是否仅仅分配更多计算资源(更长的思维链),还是遵循了性质不同的内部轨迹。在纠正生成长度的影响后,他们发现经推理训练的模型展现出独特的轨迹几何特征——在代码领域最为明显——这表明推理训练改变了计算展开的方式,而不仅仅是计算量的多少。
行为线索推理:通过监督提高推理效率与安全性
本文介绍了行为线索推理(Behavior Cue Reasoning),这是一种训练大型语言模型在特定行为前输出特定标记序列的方法,从而使推理过程更具可监控性和可控性。研究表明,该方法允许外部监控器在不牺牲性能的情况下,通过裁剪浪费的推理标记和拦截不安全操作,提高安全监督水平和推理效率。