credit-assignment

标签

Cards List
#credit-assignment

SAGE:基于属性引导规则演化的自演化分镜技能

arXiv cs.AI ↗ · 2026-08-19 缓存

SAGE是一个利用自演化规则和属性引导更新来自动化短剧制作中分镜生成的框架,实现了专家级性能,并在商业部署中减少了制作时间。

0 人收藏 0 人点赞
#credit-assignment

SkillGate: 长期视野智能体的策略内技能训练

Hugging Face Daily Papers ↗ · 2026-08-19 缓存

SkillGate 通过使用执行和技能命名令牌的独立信用通道,解决了AI智能体技能选择中的选择器信用饥饿问题,提高了成功率并减少了长期任务中误导性技能的暴露。

0 人收藏 0 人点赞
#credit-assignment

从环境反馈中学习:面向智能体强化学习的多时间尺度信用分配

arXiv cs.LG ↗ · 2026-08-11 缓存

本文介绍了EFCA,一种面向智能体强化学习的多时间尺度信用分配方法,利用环境交互中的短期反馈和中期状态历史信号,在ALFWorld和WebShop上提升任务成功率和任务质量。

0 人收藏 0 人点赞
#credit-assignment

Gated-BEPO:面向大型语言模型智能体的置信门控贝尔曼信用分配

arXiv cs.AI ↗ · 2026-08-10 缓存

Gated-BEPO 是一种针对 LLM 智能体的新型信用分配方法,它利用贝尔曼不动点估计从经验回放图中推导出步骤级信用,并通过置信门将步骤级信用与回合级信用自适应地融合。在 WebShop、ALFWorld 和视觉 Sokoban 上的实验表明,相对于现有无评论家方法,该方法具有一致性的改进。

0 人收藏 0 人点赞
#credit-assignment

@Xudong07452910: 一个 Agent 做了 20 步任务,最后只收到一个「成功 / 失败」。 训练时怎么知道,真正救了这次任务的到底是哪一步? 清华、浙大和美团团队这篇 AgentOPSD,研究的就是长时 Agent 的信用分配问题。 GRPO 通常把最终奖…

X AI KOLs Timeline ↗ · 2026-08-10 缓存

清华、浙大和美团团队提出AgentOPSD,一种递归自蒸馏的信用分配方法,将稀疏的最终奖励转化为逐步信用信号,提升长时Agent强化学习性能。在ALFWorld等任务上显著优于GRPO基线。

0 人收藏 0 人点赞
#credit-assignment

ABSeeker:通过答案回溯信用分配训练长时程搜索智能体

arXiv cs.AI ↗ · 2026-08-06 缓存

本文提出答案回溯信用分配(ABC)框架,该框架将稀疏的轨迹级结果转换为密集的步级监督,用于训练长时程搜索智能体。所得到的ABSeeker模型基于Qwen3.5-4B构建,在BrowseComp基准上取得了强劲的结果,优于同规模智能体,并与更大规模的模型相当。

0 人收藏 0 人点赞
#credit-assignment

技能的价值是什么?结构感知的智能体技能 Shapley 估值

arXiv cs.AI ↗ · 2026-08-06 缓存

本文介绍了 SkillSV,一个结构感知的 Shapley 风格框架,用于对智能体技能的内部单元进行估值,并考虑依赖关系和层次结构。它在智能体基准上展示了更好的忠实度、可操作性和解释质量。

0 人收藏 0 人点赞
#credit-assignment

AgentOPSD:智能体强化学习中的递归自蒸馏

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。

0 人收藏 0 人点赞
#credit-assignment

LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment

arXiv cs.AI ↗ · 2026-08-05 缓存

Introduces LoCA, a two-stage backpropagation-free method for small-shift adaptation of LLMs, using one-shot calibration to fit local credit assignment maps and closed-form ridge solves for low-rank adapters, achieving lower memory and time than LoRA with competitive cross-entropy on multiple benchmarks.

0 人收藏 0 人点赞
#credit-assignment

门控Q学习:按需引入离策略偏差

arXiv cs.LG ↗ · 2026-08-03 缓存

介绍了门控Q学习(Gated Q-learning),一种新的Q(λ)框架,能够在Watkins和Peng的Q学习之间平滑插值,以权衡离策略偏差和多步信用分配。提供了理论保证以及在随机游走环境中的实证验证。

0 人收藏 0 人点赞
#credit-assignment

并非所有Token都值得同等信用:面向长CoT推理的反事实敏感性信用再分配

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文提出反事实敏感性信用再分配(CSCR),这是GRPO的一种简单扩展,可降低高敏感性Token的信用,并重新归一化Token级优势,用于长CoT数学推理。它持续优于GRPO基线,同时揭示特权Token移位方向不可靠,主要反映反事实敏感性而非学习价值。

0 人收藏 0 人点赞
#credit-assignment

Harness-G:面向搜索代理的图结构检索框架

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文介绍了Harness-G,一种图结构检索框架,它将自由形式的查询生成重构为有限动作选择,以减少基于强化学习的搜索代理中的检索别名化问题。在六个问答基准测试中,Harness-G在1.5B规模下比最强基线Graph-R1高出10.74个百分点,在3B规模下高出3.98个百分点。

0 人收藏 0 人点赞
#credit-assignment

CAST: 游戏求解器作为LLM智能体的回合级教师

arXiv cs.CL ↗ · 2026-07-29 缓存

CAST是一种方法,利用游戏求解器的状态值来提供回合级信用分配信号,通过强化学习训练LLM智能体,在多个游戏中的领域内和未见难度评估中均优于基线。

0 人收藏 0 人点赞
#credit-assignment

面向长周期代理任务的进度条件组策略优化

arXiv cs.LG ↗ · 2026-07-28 缓存

提出进度条件组策略优化(ProGPO),通过在组内所有样本均失败时使用首次访问的观察覆盖率,克服长周期代理任务中的信用分配问题,在ALFWorld和WebShop上提升了性能。

0 人收藏 0 人点赞
#credit-assignment

归因市场:计划任务与执行动作之间分数信用分配的一种费雪市场模型

arXiv cs.LG ↗ · 2026-07-24 缓存

本文提出将计划任务与执行动作之间的桥梁构建为拟线性费雪市场,实现分数信用分配。引入了守恒与垃圾过滤工具,并通过熵正则化扩展模型以处理噪声,将其与最优传输统一。

0 人收藏 0 人点赞
#credit-assignment

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI ↗ · 2026-07-22 缓存

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

0 人收藏 0 人点赞
#credit-assignment

ToolVerse: 解锁大规模环境与长程任务,用于智能体强化学习

arXiv cs.AI ↗ · 2026-07-20 缓存

ToolVerse是一个框架,可从422个真实世界MCP环境(包含4438个工具)自动构建大规模可执行智能体训练环境,并提出了一种基于动态解锁采样算法的任务设计策略以生成长程任务,以及一种用于智能体强化学习中信用分配的轮次感知相对优势算法。

0 人收藏 0 人点赞
#credit-assignment

扩散责任:无权重传输的戴尔约束学习(3分钟阅读)

TLDR AI ↗ · 2026-07-20 缓存

介绍“扩散责任”方法,使神经网络在严格遵守戴尔原则的同时,通过误差扩散和模误差路由实现竞争性学习,在图像分类和强化学习上取得良好效果,且无需权重传输。

0 人收藏 0 人点赞
#credit-assignment

@ADarmouni:https://arxiv.org/pdf/2607.13988 微软研究院的一篇优秀的强化学习工作,成功提升了Qwen3小型MoE模型的性能……

X AI KOLs Timeline ↗ · 2026-07-19 缓存

本文介绍了TRACE,一种用于长周期智能体强化学习的密集信用分配方法,该方法在不使用额外评论模型的情况下,显著提升了Qwen3小型MoE模型在智能体基准测试上的表现。

0 人收藏 0 人点赞
#credit-assignment

@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…

X AI KOLs Timeline ↗ · 2026-07-19 缓存

TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈