标签
SAGE是一个利用自演化规则和属性引导更新来自动化短剧制作中分镜生成的框架,实现了专家级性能,并在商业部署中减少了制作时间。
SkillGate 通过使用执行和技能命名令牌的独立信用通道,解决了AI智能体技能选择中的选择器信用饥饿问题,提高了成功率并减少了长期任务中误导性技能的暴露。
本文介绍了EFCA,一种面向智能体强化学习的多时间尺度信用分配方法,利用环境交互中的短期反馈和中期状态历史信号,在ALFWorld和WebShop上提升任务成功率和任务质量。
Gated-BEPO 是一种针对 LLM 智能体的新型信用分配方法,它利用贝尔曼不动点估计从经验回放图中推导出步骤级信用,并通过置信门将步骤级信用与回合级信用自适应地融合。在 WebShop、ALFWorld 和视觉 Sokoban 上的实验表明,相对于现有无评论家方法,该方法具有一致性的改进。
清华、浙大和美团团队提出AgentOPSD,一种递归自蒸馏的信用分配方法,将稀疏的最终奖励转化为逐步信用信号,提升长时Agent强化学习性能。在ALFWorld等任务上显著优于GRPO基线。
本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。
本文介绍了 SkillSV,一个结构感知的 Shapley 风格框架,用于对智能体技能的内部单元进行估值,并考虑依赖关系和层次结构。它在智能体基准上展示了更好的忠实度、可操作性和解释质量。
AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。
Introduces LoCA, a two-stage backpropagation-free method for small-shift adaptation of LLMs, using one-shot calibration to fit local credit assignment maps and closed-form ridge solves for low-rank adapters, achieving lower memory and time than LoRA with competitive cross-entropy on multiple benchmarks.
介绍了门控Q学习(Gated Q-learning),一种新的Q(λ)框架,能够在Watkins和Peng的Q学习之间平滑插值,以权衡离策略偏差和多步信用分配。提供了理论保证以及在随机游走环境中的实证验证。
本文提出反事实敏感性信用再分配(CSCR),这是GRPO的一种简单扩展,可降低高敏感性Token的信用,并重新归一化Token级优势,用于长CoT数学推理。它持续优于GRPO基线,同时揭示特权Token移位方向不可靠,主要反映反事实敏感性而非学习价值。
本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。
CAST是一种方法,利用游戏求解器的状态值来提供回合级信用分配信号,通过强化学习训练LLM智能体,在多个游戏中的领域内和未见难度评估中均优于基线。
提出进度条件组策略优化(ProGPO),通过在组内所有样本均失败时使用首次访问的观察覆盖率,克服长周期代理任务中的信用分配问题,在ALFWorld和WebShop上提升了性能。
本文提出将计划任务与执行动作之间的桥梁构建为拟线性费雪市场,实现分数信用分配。引入了守恒与垃圾过滤工具,并通过熵正则化扩展模型以处理噪声,将其与最优传输统一。
S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。
ToolVerse是一个框架,可从422个真实世界MCP环境(包含4438个工具)自动构建大规模可执行智能体训练环境,并提出了一种基于动态解锁采样算法的任务设计策略以生成长程任务,以及一种用于智能体强化学习中信用分配的轮次感知相对优势算法。
介绍“扩散责任”方法,使神经网络在严格遵守戴尔原则的同时,通过误差扩散和模误差路由实现竞争性学习,在图像分类和强化学习上取得良好效果,且无需权重传输。
本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。