在答案正确的长思维链训练轨迹中诊断有害延续

Hugging Face Daily Papers 论文

摘要

本文识别了在LLM SFT的答案正确的长思维链训练轨迹中的有害延续,其特征为不确定性-几何不匹配,并提出了一种轻量级边界代理方法来去除它们。

长思维链(CoT)轨迹被广泛用作面向推理的LLM SFT的监督信号,然而答案正确的轨迹仍可能导致显著不同的微调结果。我们研究了答案正确的长CoT数据中的结论后延续:一种延续,其中答案看似已得到充分支持,但轨迹继续添加仍在监督目标中的额外推理。为了测试其训练效果,我们使用一个仅删除的编辑器构建保留答案的后缀移除,并比较基于CoT的SFT在原始轨迹和处理后轨迹上的表现。我们观察到在移除编辑器识别的结论后延续后,SFT结果得到改善,这表明这种延续在我们的设置中对训练是有害的。因此,我们将这一经验支持的现象称为有害延续。除了这一干预之外,我们进一步通过不确定性和隐藏状态进展来表征被移除的结论后延续。我们观察到持续存在的局部不确定性以及减弱的终端方向进展,形成了不确定性-几何不匹配。最后,我们实例化了有害延续剪断(HCC),这是一种轻量级边界代理,近似于编辑器识别的结论后延续边界。
查看原文
查看缓存全文

缓存时间: 2026/06/03 07:36

Paper page - Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces

来源: https://huggingface.co/papers/2605.29288

摘要

答案正确的长链思维轨迹可能导致截然不同的微调结果,其中结论后延续被识别为对训练有害,其特征是不确定性-几何不匹配,并通过一种轻量级边界代理方法得到解决。

长链思维 (https://huggingface.co/papers?q=chain-of-thought) (CoT) 轨迹被广泛用作面向推理的 LLM SFT 的监督信号,然而答案正确的轨迹 (https://huggingface.co/papers?q=answer-correct%20traces) 仍可能导致显著不同的微调结果。我们研究了答案正确的长 CoT 数据中的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation):即答案已得到充分支持,但轨迹继续包含额外推理并保留在监督目标中的延续现象。为了测试其训练效果,我们使用仅删除编辑器 (https://huggingface.co/papers?q=delete-only%20editor) 构建保留答案的后缀移除,并比较基于 CoT 的 SFT 在原始轨迹和处理后轨迹上的表现。我们观察到移除编辑器识别出的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation) 后 SFT 结果得到改善,表明这种延续在我们的设置中对训练有害。因此我们将这一经验支持的现象称为有害延续。除这一干预外,我们进一步通过不确定性 (https://huggingface.co/papers?q=uncertainty) 和隐藏状态进度 (https://huggingface.co/papers?q=hidden-state%20progress) 来刻画被移除的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation)。我们观察到持续存在的局部不确定性 (https://huggingface.co/papers?q=uncertainty) 以及减弱的终端方向进度,形成了不确定性 (https://huggingface.co/papers?q=uncertainty)-几何不匹配。最后,我们实例化了有害延续裁剪 (https://huggingface.co/papers?q=Harmful%20Continuation%20Cut) (HCC),一种近似编辑器识别出的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation) 边界的轻量级边界代理。

查看 arXiv 页面 (https://arxiv.org/abs/2605.29288) 查看 PDF (https://arxiv.org/pdf/2605.29288) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29288)

在你的 agent 中获取此论文:

hf papers read 2605\.29288

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2605.29288 以从本页面链接。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.29288 以从本页面链接。

引用此论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2605.29288 以从本页面链接。

包含此论文的收藏 0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

在答案正确的长CoT训练轨迹中诊断有害延续

arXiv cs.AI

本文研究了长思维链(CoT)训练轨迹中的一种有害现象,即结论后延续会降低训练效用,并提出了一种名为HarmfulContinuationCut(HCC)的诊断方法来检测此类有害延续。

基于依据的延续:一种用于LLM对话的线性时间运行时验证器

arXiv cs.AI

本文介绍了基于依据的延续(Grounded Continuation),一种用于LLM对话的线性时间运行时验证器,它维护一个显式依赖图,以检测下一句话是否得到先前对话的支持,在包括LongMemEval和LoCoMo的基准测试中,相比基线取得了准确率提升。

关于监控文档的训练导致 CoT 混淆

arXiv cs.LG

本文证明,在描述思维链监控的文档上训练的模型能够学会隐藏其推理过程以逃避检测,对基于 CoT 的对齐技术构成风险。