在答案正确的长思维链训练轨迹中诊断有害延续
摘要
本文识别了在LLM SFT的答案正确的长思维链训练轨迹中的有害延续,其特征为不确定性-几何不匹配,并提出了一种轻量级边界代理方法来去除它们。
查看缓存全文
缓存时间: 2026/06/03 07:36
Paper page - Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces
来源: https://huggingface.co/papers/2605.29288
摘要
答案正确的长链思维轨迹可能导致截然不同的微调结果,其中结论后延续被识别为对训练有害,其特征是不确定性-几何不匹配,并通过一种轻量级边界代理方法得到解决。
长链思维 (https://huggingface.co/papers?q=chain-of-thought) (CoT) 轨迹被广泛用作面向推理的 LLM SFT 的监督信号,然而答案正确的轨迹 (https://huggingface.co/papers?q=answer-correct%20traces) 仍可能导致显著不同的微调结果。我们研究了答案正确的长 CoT 数据中的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation):即答案已得到充分支持,但轨迹继续包含额外推理并保留在监督目标中的延续现象。为了测试其训练效果,我们使用仅删除编辑器 (https://huggingface.co/papers?q=delete-only%20editor) 构建保留答案的后缀移除,并比较基于 CoT 的 SFT 在原始轨迹和处理后轨迹上的表现。我们观察到移除编辑器识别出的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation) 后 SFT 结果得到改善,表明这种延续在我们的设置中对训练有害。因此我们将这一经验支持的现象称为有害延续。除这一干预外,我们进一步通过不确定性 (https://huggingface.co/papers?q=uncertainty) 和隐藏状态进度 (https://huggingface.co/papers?q=hidden-state%20progress) 来刻画被移除的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation)。我们观察到持续存在的局部不确定性 (https://huggingface.co/papers?q=uncertainty) 以及减弱的终端方向进度,形成了不确定性 (https://huggingface.co/papers?q=uncertainty)-几何不匹配。最后,我们实例化了有害延续裁剪 (https://huggingface.co/papers?q=Harmful%20Continuation%20Cut) (HCC),一种近似编辑器识别出的结论后延续 (https://huggingface.co/papers?q=post-conclusion%20continuation) 边界的轻量级边界代理。
查看 arXiv 页面 (https://arxiv.org/abs/2605.29288) 查看 PDF (https://arxiv.org/pdf/2605.29288) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.29288)
在你的 agent 中获取此论文:
hf papers read 2605\.29288
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.29288 以从本页面链接。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.29288 以从本页面链接。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2605.29288 以从本页面链接。
包含此论文的收藏 0
没有包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
在答案正确的长CoT训练轨迹中诊断有害延续
本文研究了长思维链(CoT)训练轨迹中的一种有害现象,即结论后延续会降低训练效用,并提出了一种名为HarmfulContinuationCut(HCC)的诊断方法来检测此类有害延续。
推理的幻象:通过Zero-CoT截断揭示LLM中的规避性数据污染
本文提出Zero-CoT探针(ZCP),一种黑盒检测方法,通过截断思维链推理并比较扰动数据集上的性能来识别LLM中的规避性数据污染,实现了对直接和间接污染的强大检测。
可解释的推理轨迹,出人意料的结果:调查基于推理轨迹的知识蒸馏中的不匹配
本文研究了LLM中基于推理轨迹的知识蒸馏中的关键不匹配问题,揭示了语义正确的思维链推理轨迹与最终答案正确性没有可靠相关性,以及为优化模型性能而优化的推理轨迹往往对终端用户的可解释性最差。
基于依据的延续:一种用于LLM对话的线性时间运行时验证器
本文介绍了基于依据的延续(Grounded Continuation),一种用于LLM对话的线性时间运行时验证器,它维护一个显式依赖图,以检测下一句话是否得到先前对话的支持,在包括LongMemEval和LoCoMo的基准测试中,相比基线取得了准确率提升。
关于监控文档的训练导致 CoT 混淆
本文证明,在描述思维链监控的文档上训练的模型能够学会隐藏其推理过程以逃避检测,对基于 CoT 的对齐技术构成风险。