credit-assignment

标签

Cards List
#credit-assignment

CounterRoute:基于层次化反事实信用分配的自路由推理

arXiv cs.AI ↗ · 昨天 缓存

CounterRoute 引入了一个在线强化学习框架,该框架在双模式语言模型中联合学习路由和模式条件响应,从而提高准确性并减少推理令牌。

0 人收藏 0 人点赞
#credit-assignment

SLCA-GRPO: 解决工具调用强化学习中的跨段信用分配错误

arXiv cs.AI ↗ · 昨天 缓存

SLCA-GRPO 引入段锁定信用分配,通过解耦优势估计和使用层级奖励来改善工具调用代理的强化学习,从而实现更快的收敛和更高的准确性。

0 人收藏 0 人点赞
#credit-assignment

恰当地归因:用于高效推理的冗余感知学习

arXiv cs.CL ↗ · 2天前 缓存

本文介绍了 RECAP,一种冗余感知学习方法,通过根据步骤的结构角色和效能分配信用,提升了大型推理模型的效率,在提高准确性的同时减少了令牌使用量。

0 人收藏 0 人点赞
#credit-assignment

分解子任务强化学习 (RLDS)

arXiv cs.AI ↗ · 2天前 缓存

本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。

0 人收藏 0 人点赞
#credit-assignment

ReCAST:在线扩散强化中的时间步奖励信用分配

arXiv cs.LG ↗ · 2026-09-15 缓存

ReCAST 提出了一种在扩散模型微调中实现按奖励、时间步依赖的信用分配方法,将用户偏好与时间分配分离,以提升对齐性和信息价值。

0 人收藏 0 人点赞
#credit-assignment

反向传播的替代方案:Augmented Lagrangian Predictive Coding

Hacker News Top ↗ · 2026-09-14 缓存

PC-ALM 是一种局部训练方法,通过层局部动态系统传播监督信用,使得训练多达1000层的网络无需反向传播成为可能,同时性能几乎与反向传播相当。

0 人收藏 0 人点赞
#credit-assignment

面向长期LLM智能体强化学习的粒度自适应信用分配

arXiv cs.LG ↗ · 2026-09-14 缓存

本文提出了GACA,一种粒度自适应的信用分配方法,用于长期LLM智能体强化学习,通过适应分辨率到步骤重要性来提高任务成功率。

0 人收藏 0 人点赞
#credit-assignment

TIGPO:用于长视域LLM智能体的时间实例图策略优化

arXiv cs.LG ↗ · 2026-09-04 缓存

TIGPO提出了一种时间实例图策略优化方法,通过持久转移图和重访槽,扩展了基于图的信用分配跨策略更新,用于长视域LLM智能体,以改善优势估计和在ALFWorld和WebShop等基准测试上的性能。

0 人收藏 0 人点赞
#credit-assignment

PGPO:面向多轮智能体任务的势引导策略优化

arXiv cs.AI ↗ · 2026-09-03 缓存

PGPO 提出势引导策略优化用于多轮智能体任务,使得在 LLM 后训练中实现更细粒度的信用分配,并在 ALFWorld 和 WebShop 基准测试上展示出强劲结果。

0 人收藏 0 人点赞
#credit-assignment

MASkills:多智能体LLM系统的持续技能优化

arXiv cs.AI ↗ · 2026-09-03 缓存

MASkills 提出了一个持续学习框架,通过智能体技能优化多智能体LLM系统,使用基于技能的信用分配和层次聚合来提升在 HotpotQA 和 GAIA 等任务上的性能。

0 人收藏 0 人点赞
#credit-assignment

CHIME: 用于长时域代理规划的信用感知分层记忆演化

arXiv cs.AI ↗ · 2026-09-03 缓存

CHIME是一种信用感知分层记忆框架,它分离规划和执行记忆库,通过准确归因任务结果来提高长时域代理规划,并优于基线方法。

0 人收藏 0 人点赞
#credit-assignment

DRACO:基于动态评分标准的细粒度信用分配,用于长期代理训练

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

DRACO是一种强化学习方法,通过动态生成评分标准并重新分配轨迹分数来提升长期代理的性能,无需使用验证器。

0 人收藏 0 人点赞
#credit-assignment

CDPR:基于反事实优势的信用分配方法在成本感知序列医疗诊断中的应用

arXiv cs.AI ↗ · 2026-09-01 缓存

CDPR是一种基于反事实优势的信用分配方法,用于通过强化学习训练成本感知的序列医疗诊断模型,在提高诊断准确性的同时减少检查成本和数量。

0 人收藏 0 人点赞
#credit-assignment

@rohanpaul_ai: 这篇论文展示了训练多轮代理的更好方法:为每轮单独评分,然后使用自我教师来集中注意力……

X AI KOLs Following ↗ · 2026-08-31 缓存

该论文介绍了CREST,一种通过为每轮分配独立信用并使用自我教师来集中学习而不覆盖奖励的方法,以改善多轮代理训练,并在基准测试中展示性能提升。

0 人收藏 0 人点赞
#credit-assignment

Contrastive Branch Policy Optimization

arXiv cs.LG ↗ · 2026-08-26 缓存

CBPO引入了一种对比分支策略优化方法,用于具有可验证奖励的强化学习中的细粒度信用分配,提升了语言模型在多个基准测试中集成工具的推理任务的性能。

0 人收藏 0 人点赞
#credit-assignment

HiDiffTIR:多轮工具集成推理的层次难度感知策略优化

arXiv cs.CL ↗ · 2026-08-25 缓存

提出HiDiffTIR,一种面向LLM代理中多轮工具集成推理的层次难度感知策略优化框架,通过细粒度信用分配提升性能和工具调用准确性。

0 人收藏 0 人点赞
#credit-assignment

让信用紧随计算:面向大语言模型强化学习的架构感知信用传递

arXiv cs.AI ↗ · 2026-08-25 缓存

论文提出了计算条件化信用传递(CCT)和 CompPO 算法,用于大语言模型强化学习中的架构感知信用分配,性能优于 GRPO 等基线方法。

0 人收藏 0 人点赞
#credit-assignment

MileGPO:基于局部证据的里程碑推理用于长期LLM代理的图策略优化

arXiv cs.LG ↗ · 2026-08-21 缓存

MileGPO提出了一种用于长期LLM代理信用分配的方法,该方法利用基于局部证据的里程碑推理,并在ALFWorld和WebShop基准测试中实现了最先进的性能。

0 人收藏 0 人点赞
#credit-assignment

无真值的信用分配:基于执行重放审计LLM代理中的步骤级信用分配

arXiv cs.LG ↗ · 2026-08-21 缓存

本文使用执行重放的因果真值来审计LLM代理中的步骤级信用分配,发现常见的信用信号在识别因果重要步骤方面未能优于随机水平,这对训练方法具有启示意义。

0 人收藏 0 人点赞
#credit-assignment

迈向更好的多轮用户交互代理:下一用户轮次不止于上下文

arXiv cs.AI ↗ · 2026-08-19 缓存

本文介绍了反馈感知信用分配(Faca),通过利用下一用户轮次的反应作为局部信用信号来改进多轮工具使用语言代理,在交互式基准测试上显示出显著的性能提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈