@mosh_levy: 新论文!人们将推理轨迹视为文本,但如果我们能做得更好呢?我们证明我们可以,通过…

X AI KOLs Timeline 论文

摘要

介绍了行为预测器(BFs),它以推理轨迹为输入,并以极低的成本实现比前沿模型更准确的预测。

新论文! 人们将推理轨迹视为文本,但如果我们能做得更好呢? 我们证明我们可以,通过训练行为预测器(BFs),它以推理轨迹为输入,并以极低的成本实现比前沿模型更准确的预测。🧵 https://t.co/knr0pEmXQi
查看原文
查看缓存全文

缓存时间: 2026/06/12 04:52

新论文! 人们把推理轨迹当作文本对待,但如果我们能做得更好呢? 我们证明这是可行的——通过训练行为预测器(BFs),将推理轨迹作为输入,就能以前沿模型几分之一的成本做出更准确的预测。

预测模型行为的常规方法是先解释其计算过程,再基于解释进行推理。 我们跳过了解释步骤,直接将预测视为一个学习问题。

我们训练BFs基于单条轨迹预测行为。 从待预测的目标模型初始化BFs,加上一个小型预测头,端到端训练它们预测未来行为的属性。 只需通过查询目标模型就能获得标注训练数据。

我们将该方法应用于预测两类行为属性: 重跑时是否会给出相同答案(重跑一致性), 以及输入的哪些部分导致了该答案(反事实敏感性)。

BFs超越了阅读相同轨迹的前沿模型。 它们的成本也低得多:只需一次前向传播即可获得预测,而体积大得多的前沿模型需要在其自身推理轨迹中生成数千个token。

我们还发现,BFs只需少量调优就能泛化到新数据集,甚至能胜任标记模型是否依赖所给提示的任务——这是检验推理是否忠实的一个常见测试。

关键点:推理轨迹携带了超越文本阅读所能传达的未来行为信号。 我们建议将轨迹视为可学习模式的数据,而非待阅读的文本。 该工作是与@yoavgo和@AsaCoopStick合作完成的。 https://arxiv.org/pdf/2606.11445

相似文章

将预测未来行为作为一项学习任务

Hugging Face Daily Papers

本文提出训练行为预测器,从单条推理轨迹预测大型推理模型的输出,在计算成本更低的情况下优于GPT-5.4和Claude Opus-4.6等大型语言模型,绕过了传统的可解释性方法。

将未来行为预测作为学习任务

arXiv cs.AI

本文提出了 Behavior Forecasters,一种从推理轨迹中预测 LRM 未来行为(如答案一致性和输入敏感性)的学习方法,以更低的成本超越了 GPT-5.4 和 Claude Opus 4.6。

推理模型并非只是思考更久,其运作轨迹也不同

arXiv cs.CL

本文通过分析代码、数学和SAT领域中的隐藏状态轨迹几何特征,探究经推理训练的语言模型是否仅仅分配更多计算资源(更长的思维链),还是遵循了性质不同的内部轨迹。在纠正生成长度的影响后,他们发现经推理训练的模型展现出独特的轨迹几何特征——在代码领域最为明显——这表明推理训练改变了计算展开的方式,而不仅仅是计算量的多少。

行为线索推理:通过监督提高推理效率与安全性

arXiv cs.AI

本文介绍了行为线索推理(Behavior Cue Reasoning),这是一种训练大型语言模型在特定行为前输出特定标记序列的方法,从而使推理过程更具可监控性和可控性。研究表明,该方法允许外部监控器在不牺牲性能的情况下,通过裁剪浪费的推理标记和拦截不安全操作,提高安全监督水平和推理效率。