监控内部独白:探针轨迹揭示推理动态

Hugging Face Daily Papers 论文

摘要

本文介绍了一种通过分析探针轨迹(即概念概率在生成token上的演变)来监控大型推理模型推理过程的方法。该方法利用隐藏表示中的时间特征和信号处理特征,更好地预测未来模型行为,通过最大池化达到了高达95%的AUROC。

大型推理模型(LRMs)通过其思维链(CoT)推理为安全监控带来了新的机遇。然而,CoT并不总是忠实于模型的最终输出,这削弱了其作为监控工具的可靠性。为了解决这个问题,我们研究了LRMs的隐藏表示,以判断是否可以从提示和CoT表示中预测未来行为。通过在每个生成的token上评估探针,我们构建了一条探针轨迹,即概念概率在推理过程中的连续演变。我们发现,与单一静态预测相比,在完整轨迹上检查时,未来模型行为更易区分。为了刻画这些时间动态,我们提取了捕捉波动性、趋势和稳态行为的信号处理特征,显著改善了未来模型状态的分离。我们还提出了两个方法论见解。第一,基于模板的训练数据与动态生成的模型响应达到了近乎一致,消除了昂贵的初始推理和标注需求。第二,池化操作的选择至关重要:平均池化和最后token方法性能退化至近乎随机,而最大池化达到了高达95%的AUROC,并产生了稳定的探针轨迹。我们使用四个数据集和四个推理模型,涵盖安全和数学领域,证明了轨迹特征编码了任务特定的动态,从而提升了结果的可分离性。这些发现将探针轨迹确立为监控LRM行为的补充框架。 警告:本文包含潜在有害内容。
查看原文
查看缓存全文

缓存时间: 2026/05/19 10:31

论文页面 - 监控内部独白:探针轨迹揭示推理动态

来源:https://huggingface.co/papers/2605.18549

摘要

大型推理模型中的思维链推理通过隐藏表征的时序分析提升了安全监控能力,与静态方法相比,探针轨迹和信号处理特征能够增强对未来模型行为的预测。

大型推理模型(LRM)通过其思维链(CoT)推理为安全监控带来了新机遇。然而,思维链并不总是忠实反映模型的最终输出,这削弱了其作为监控工具的可靠性。为解决这一问题,我们研究了LRM的隐藏表征,以确定能否从提示和思维链表征中预测未来行为。通过评估每个生成token上的探针,我们构建了一条探针轨迹,即概念概率在推理过程中连续演化的路径。我们发现,相比于单一静态预测,在整个轨迹上考察时,未来模型行为更易于区分。为了刻画这些时序动态,我们提取了捕捉波动性、趋势和稳态行为的信号处理特征,显著提升了未来模型状态的分离效果。我们还提出了两个方法论见解。第一,基于模板的训练数据与动态生成的模型响应性能相当,省去了代价高昂的初始推理和标注步骤。第二,池化操作的选择至关重要:平均池化和最后token方法的性能降至接近随机水平,而最大池化达到了高达95%的AUROC,并产生了稳定的探针轨迹。通过在安全与数学领域的四个数据集和四个推理模型上的实验,我们证明了轨迹特征编码了任务特定的动态,从而改善了结果的分离性。这些发现将探针轨迹确立为监控LRM行为的补充框架。警告:本文包含可能有害的内容。

查看arXiv页面(https://arxiv.org/abs/2605.18549)查看PDF(https://arxiv.org/pdf/2605.18549)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.18549)

在您的agent中获取此论文:

hf papers read 2605\.18549

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型关联此论文

请在模型README.md中引用 arxiv.org/abs/2605.18549 以从此页面链接。

引用此论文的数据集0

无数据集关联此论文

请在数据集README.md中引用 arxiv.org/abs/2605.18549 以从此页面链接。

引用此论文的Space0

无Space关联此论文

请在Space README.md中引用 arxiv.org/abs/2605.18549 以从此页面链接。

包含此论文的合集0

无合集包含此论文

请将此论文添加到一个合集(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

推理模型并非只是思考更久,其运作轨迹也不同

arXiv cs.CL

本文通过分析代码、数学和SAT领域中的隐藏状态轨迹几何特征,探究经推理训练的语言模型是否仅仅分配更多计算资源(更长的思维链),还是遵循了性质不同的内部轨迹。在纠正生成长度的影响后,他们发现经推理训练的模型展现出独特的轨迹几何特征——在代码领域最为明显——这表明推理训练改变了计算展开的方式,而不仅仅是计算量的多少。

ReasoningFlow: 用于理解LLM推理轨迹的篇章结构

arXiv cs.CL

介绍 ReasoningFlow,一个将大语言模型推理轨迹的篇章结构捕获为有向无环图的框架,从而能够细粒度分析推理行为(如自我反思和回溯)。基于对数千条轨迹的手动和自动标注,揭示了模型之间的结构相似性,并且大多数错误步骤并不贡献于最终答案。

评估思维链的可监控性

OpenAI Blog

OpenAI研究人员引入了一个框架和一套包含13项评估的系统,用于衡量大型语言模型中思维链的可监控性。研究发现,监控推理过程比仅监控输出有效得多,这为AI安全及规模化监督提供了重要启示。

推理模型难以控制其思维链,但这其实是好事

OpenAI Blog

OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。