标签
CounterRoute 引入了一个在线强化学习框架,该框架在双模式语言模型中联合学习路由和模式条件响应,从而提高准确性并减少推理令牌。
SLCA-GRPO 引入段锁定信用分配,通过解耦优势估计和使用层级奖励来改善工具调用代理的强化学习,从而实现更快的收敛和更高的准确性。
本文介绍了 RECAP,一种冗余感知学习方法,通过根据步骤的结构角色和效能分配信用,提升了大型推理模型的效率,在提高准确性的同时减少了令牌使用量。
本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。
ReCAST 提出了一种在扩散模型微调中实现按奖励、时间步依赖的信用分配方法,将用户偏好与时间分配分离,以提升对齐性和信息价值。
PC-ALM 是一种局部训练方法,通过层局部动态系统传播监督信用,使得训练多达1000层的网络无需反向传播成为可能,同时性能几乎与反向传播相当。
本文提出了GACA,一种粒度自适应的信用分配方法,用于长期LLM智能体强化学习,通过适应分辨率到步骤重要性来提高任务成功率。
TIGPO提出了一种时间实例图策略优化方法,通过持久转移图和重访槽,扩展了基于图的信用分配跨策略更新,用于长视域LLM智能体,以改善优势估计和在ALFWorld和WebShop等基准测试上的性能。
PGPO 提出势引导策略优化用于多轮智能体任务,使得在 LLM 后训练中实现更细粒度的信用分配,并在 ALFWorld 和 WebShop 基准测试上展示出强劲结果。
MASkills 提出了一个持续学习框架,通过智能体技能优化多智能体LLM系统,使用基于技能的信用分配和层次聚合来提升在 HotpotQA 和 GAIA 等任务上的性能。
CHIME是一种信用感知分层记忆框架,它分离规划和执行记忆库,通过准确归因任务结果来提高长时域代理规划,并优于基线方法。
DRACO是一种强化学习方法,通过动态生成评分标准并重新分配轨迹分数来提升长期代理的性能,无需使用验证器。
CDPR是一种基于反事实优势的信用分配方法,用于通过强化学习训练成本感知的序列医疗诊断模型,在提高诊断准确性的同时减少检查成本和数量。
该论文介绍了CREST,一种通过为每轮分配独立信用并使用自我教师来集中学习而不覆盖奖励的方法,以改善多轮代理训练,并在基准测试中展示性能提升。
CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。
提出HiDiffTIR,一种面向LLM代理中多轮工具集成推理的层次难度感知策略优化框架,通过细粒度信用分配提升性能和工具调用准确性。
论文提出了计算条件化信用传递(CCT)和 CompPO 算法,用于大语言模型强化学习中的架构感知信用分配,性能优于 GRPO 等基线方法。
MileGPO提出了一种用于长期LLM代理信用分配的方法,该方法利用基于局部证据的里程碑推理,并在ALFWorld和WebShop基准测试中实现了最先进的性能。
本文使用执行重放的因果真值来审计LLM代理中的步骤级信用分配,发现常见的信用信号在识别因果重要步骤方面未能优于随机水平,这对训练方法具有启示意义。
本文介绍了反馈感知信用分配(Faca),通过利用下一用户轮次的反应作为局部信用信号来改进多轮工具使用语言代理,在交互式基准测试上显示出显著的性能提升。