有限监督下的链式思维推理再探讨:半监督链式思维学习
摘要
本文介绍了Semi-CoT,一种用于链式思维推理的半监督学习框架,该框架利用未标记问题并通过基于熵的选择生成可靠的伪推理链,在数学推理基准上展示了有希望但混合的结果。
arXiv:2607.01511v1 公告类型:新
摘要:链式思维(CoT)推理已成为激活大型语言模型潜在推理能力的有效方法。然而,现有的大多数CoT方法主要将推理链用作推理时的提示,而生成的推理轨迹很少被重复利用作为半监督学习信号。在本报告中,我们定义了\\textbf{半监督链式思维学习}并提出了\\textbf{Semi-CoT},一个使用未标记问题构建伪推理监督的简单框架。Semi-CoT为每个未标记问题采样多个伪CoT,估计答案层面的语义熵,并选择低熵推理链作为可靠的伪CoT演示。这将CoT的自我训练视角从推理时的细化扩展到半监督伪监督。在AQuA、SVAMP、GSM8K和MultiArith上的初步实验表明,熵门筛选出高精度的伪CoT,伪答案精度范围从$91.36\\%$到$100\\%$。Semi-CoT在SVAMP和GSM8K上也有小幅提升,而AQuA显示出负迁移,MultiArith达到了上限。这些结果表明,未标记问题可以提供可靠的伪推理信号,但其有效使用仍需要更强的演示选择或学生训练。
查看缓存全文
缓存时间: 2026/07/03 05:44
# 在有限监督下重新审视思维链推理:半监督思维链学习 来源:https://arxiv.org/abs/2607.01511 查看PDF (https://arxiv.org/pdf/2607.01511) > 摘要:思维链(Chain-of-Thought, CoT)推理已成为激活大型语言模型潜在推理能力的有效方法。然而,现有的大多数CoT方法主要将推理链用作推理时的提示,而生成推理轨迹很少被复用为半监督学习信号。在本报告中,我们定义了**半监督思维链学习**,并提出了**Semi-CoT**——一个简单的框架,它利用无标签问题构建伪推理监督。Semi-CoT为每个无标签问题采样多个伪CoT,估计答案级别的语义熵,并选择低熵推理链作为可靠的伪CoT示例。这将CoT的自我训练视角从推理时优化扩展为半监督伪监督。在AQuA、SVAMP、GSM8K和MultiArith上的初步实验表明,熵门控选择了高精度的伪CoT,伪答案精度范围从$91.36\%$到$100\%$。Semi-CoT在SVAMP和GSM8K上也取得了微小提升,而AQuA显示出负迁移,MultiArith则达到了天花板。这些结果表明,无标签问题可以提供可靠的伪推理信号,但其有效使用仍需更强的示例选择或学生训练。 ## 提交历史 来自:洪阳何 [查看邮件 (https://arxiv.org/show-email/841459d4/2607.01511)] **\[v1\]** 2026年7月1日星期三 22:17:39 UTC(18,967 KB)
相似文章
基于代理上下文的链式思维微调长上下文推理
提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。
训练连续思维链模型:两种机制的故事
本文介绍了C-MTP,一种用于训练连续思维链模型的直接监督方法,该方法将推理轨迹压缩为潜在表示。该方法在简单任务上表现良好,但揭示了直接和间接监督方法在处理复杂长推理轨迹时均存在困难,性能下降约65%。
带有自回归思维链推理的在线学习理论
本文建立了一个关于自回归思维链推理的在线学习理论框架,分析了端到端监督和轨迹监督模型下的错误边界。
思维链推理在实际应用中并非总是忠实的
本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。
思维链何时有帮助、何时有害:LLM推理中串行深度瓶颈的实证研究
这项实证研究测试了思维链提示何时有助于或损害LLM推理,发现CoT在GSM8K和MATH等深层串行任务上带来巨大收益,但在MMLU和ARC-Challenge等浅层任务上则是冗余的,这与串行深度瓶颈框架一致。