STRIDE:面向LLM推理的可学习逐步语言反馈
摘要
STRIDE提出了一种训练框架,使用可学习的逐步语言反馈而非标量奖励来提升LLM推理能力,在多种基准测试上取得了最先进的结果。
相似文章
STRIDE-ED: 一个策略驱动的多步推理框架用于同情心对话系统
STRIDE-ED 是一个为同情心对话系统设计的策略驱动推理框架,它结合了结构化的多阶段推理、数据精化管道和两阶段训练(有监督微调 + 多目标强化学习)来改进情感理解和回复生成。该框架在开源大语言模型上的自动评指标和人工评估上都展示了一致的改进。
MILES:用于自我提升大型语言模型推理的可学习选择模块化指令记忆
MILES是一个通过动态扩展逐步记忆并使用可学习选择头来提升LLM推理能力的框架,实现了更好的准确性-效率权衡。
强化步骤级推理以实现LLM中的有效自我纠正
本文介绍了SFS-DPO,一种用于LLM中步骤级自我验证和自我纠正的强化学习两阶段框架,并提出了教师辅助变体SFS-DPO-R。实验表明,在多个LLM上,该方法以更少的训练数据相比先前方法在自我纠正有效性上取得了改进。
STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation
This paper introduces STRIVE, an LLM-based framework for jointly generating and evaluating controlled event sets for psycholinguistic plausibility judgments. Experiments show that adding a global reasoning scratchpad and evaluator-guided refinement substantially improves generation quality, though near-boundary events remain challenging.
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。