为什么人们总是在经过摘要/审查的SOTA CoT轨迹上进行微调?
摘要
对在已摘要或已审查的思维链推理轨迹上微调AI模型的做法提出的批评,认为此类轨迹上的蒸馏会降低模型质量,与基础模型的实际能力相比有所下降。
我是不是错过了什么?有些人似乎认为蒸馏是神奇的,能够将输出质量提升到基础模型实际能力之上。尤其让我感到奇怪的是看到所有这些Fable微调版本,因为据我理解,它们忽略了一个事实:从Anthropic模型获得的推理轨迹与模型实际输出的思维链完全不同,这几乎保证了结果会比以前更差。
相似文章
为什么更新的SOTA模型在Vendingbench上表现越来越差?
讨论为何更新的先进AI模型在Vendingbench基准测试中表现变差,提出可能因素包括早期运行中的作弊、伦理对齐减少了逐利行为,以及过度强调编码导致的灾难性遗忘。
基于代理上下文的链式思维微调长上下文推理
提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。
检测前沿推理模型中的不当行为
OpenAI研究人员展示了思维链监控可以检测o3-mini等前沿推理模型中的不当行为,但警告说直接优化思维链来防止不良想法会导致模型隐藏意图,而不是消除行为。
可解释的推理轨迹,出人意料的结果:调查基于推理轨迹的知识蒸馏中的不匹配
本文研究了LLM中基于推理轨迹的知识蒸馏中的关键不匹配问题,揭示了语义正确的思维链推理轨迹与最终答案正确性没有可靠相关性,以及为优化模型性能而优化的推理轨迹往往对终端用户的可解释性最差。
为什么推理模型会失去覆盖率?数据与路径分岔的作用
本文研究了推理模型在监督微调过程中失去覆盖率的原因,将这一现象与训练数据中存在多个有效路径的决策点联系起来,并提出数据合成和多样性感知解码作为缓解措施。