标签
本文提出了一种LLM推理策略的分类法,沿着两个正交轴:快速与慢速思考、内部与外部知识,并综述了近期自适应推理方法。
本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。
提出Strategy-Induct框架,该框架仅从示例问题中归纳任务级指令,无需标注答案,首先为每个问题生成显式推理策略,然后利用问题-策略对来归纳指令。该方法在仅包含问题的场景下,跨多个任务和模型规模均优于现有方法。