为什么人们总是在经过摘要/审查的SOTA CoT轨迹上进行微调?

Reddit r/LocalLLaMA 新闻

摘要

对在已摘要或已审查的思维链推理轨迹上微调AI模型的做法提出的批评,认为此类轨迹上的蒸馏会降低模型质量,与基础模型的实际能力相比有所下降。

我是不是错过了什么?有些人似乎认为蒸馏是神奇的,能够将输出质量提升到基础模型实际能力之上。尤其让我感到奇怪的是看到所有这些Fable微调版本,因为据我理解,它们忽略了一个事实:从Anthropic模型获得的推理轨迹与模型实际输出的思维链完全不同,这几乎保证了结果会比以前更差。
查看原文

相似文章

基于代理上下文的链式思维微调长上下文推理

arXiv cs.CL

提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。

检测前沿推理模型中的不当行为

OpenAI Blog

OpenAI研究人员展示了思维链监控可以检测o3-mini等前沿推理模型中的不当行为,但警告说直接优化思维链来防止不良想法会导致模型隐藏意图,而不是消除行为。