credit-assignment

标签

Cards List
#credit-assignment

EvoSteer:基于参考锚定信用分配的在线自进化图编排

arXiv cs.AI ↗ · 昨天 缓存

EvoSteer 为基于 LLM 的多智能体系统提出了一种在线自进化图编排范式,利用参考锚定的流匹配损失(AnchorTB)以及经过验证的技能准入机制,在执行过程中修复失败的步骤,在涵盖问答、数学、代码与决策等十二个数据集上均优于各类基线方法。

0 人收藏 0 人点赞
#credit-assignment

面向智能体强化学习信用分配的关键决策定位

arXiv cs.CL ↗ · 2天前 缓存

提出 ProVer 框架,通过 agentic judge 筛选可能的关键决策片段,并利用前向与后续采样的终端成功率来验证优势值,从而实现 agentic RL 中的细粒度信用分配。在 ALFWorld、WebShop 和 SearchQA 上,较 GRPO 最高提升 9.91%。

0 人收藏 0 人点赞
#credit-assignment

学会跳过什么:反事实信用分配的高效多智能体LLM工作流

arXiv cs.AI ↗ · 4天前 缓存

本文介绍了学会跳过什么(LW2S),一种利用反事实信用分配来优化多智能体LLM工作流的方法,通过选择性跳过组件来降低令牌成本,同时保持或提高准确性。

0 人收藏 0 人点赞
#credit-assignment

重新思考隐式视觉推理:将隐式推理锚定于视觉证据

Hugging Face Daily Papers ↗ · 4天前 缓存

本文指出了多模态大语言模型隐式视觉推理中的「隐式证据-信用鸿沟」,并提出 ReaLVR,通过对比正确/错误答案以及相关/不匹配图像,为自由运行的隐式轨迹引入视觉证据监督。ReaLVR 在三大模型系列上均优于 LVR 基线(在 Qwen2.5-VL-7B 上五任务平均达到 63.7%),并能稳健地扩展到 2350 亿参数的前沿模型。

0 人收藏 0 人点赞
#credit-assignment

超越时间戳:面向长期智能体的决策对齐在线策略蒸馏

Hugging Face Daily Papers ↗ · 5天前 缓存

本文介绍了AlignOPSD,用于解决长期智能体在线策略自蒸馏中的决策-时间戳不匹配问题,与基线方法相比,在ALFWorld、WebShop和Search-QA等基准测试中提高了性能。

0 人收藏 0 人点赞
#credit-assignment

意外成功与重复失败:用于大语言模型推理中探索的熵引导信用分配

Hugging Face Daily Papers ↗ · 5天前 缓存

本文提出了熵优势策略优化(EAPO),一种用于大语言模型强化学习的熵引导信用分配方法,该方法不对称地处理成功与失败,以增强探索并在推理任务上实现更优性能。

0 人收藏 0 人点赞
#credit-assignment

CounterRoute:基于层次化反事实信用分配的自路由推理

arXiv cs.AI ↗ · 2026-09-25 缓存

CounterRoute 引入了一个在线强化学习框架,该框架在双模式语言模型中联合学习路由和模式条件响应,从而提高准确性并减少推理令牌。

0 人收藏 0 人点赞
#credit-assignment

SLCA-GRPO: 解决工具调用强化学习中的跨段信用分配错误

arXiv cs.AI ↗ · 2026-09-25 缓存

SLCA-GRPO 引入段锁定信用分配,通过解耦优势估计和使用层级奖励来改善工具调用代理的强化学习,从而实现更快的收敛和更高的准确性。

0 人收藏 0 人点赞
#credit-assignment

恰当地归因:用于高效推理的冗余感知学习

arXiv cs.CL ↗ · 2026-09-24 缓存

本文介绍了 RECAP,一种冗余感知学习方法,通过根据步骤的结构角色和效能分配信用,提升了大型推理模型的效率,在提高准确性的同时减少了令牌使用量。

0 人收藏 0 人点赞
#credit-assignment

分解子任务强化学习 (RLDS)

arXiv cs.AI ↗ · 2026-09-24 缓存

本文介绍了基于分解子任务的强化学习(RLDS),该方法将轨迹奖励分解为每个子任务的优势,以改进语言模型智能体强化学习中的信用分配,并在高异质性智能体基准测试上显示出显著提升。

0 人收藏 0 人点赞
#credit-assignment

ReCAST:在线扩散强化中的时间步奖励信用分配

arXiv cs.LG ↗ · 2026-09-15 缓存

ReCAST 提出了一种在扩散模型微调中实现按奖励、时间步依赖的信用分配方法,将用户偏好与时间分配分离,以提升对齐性和信息价值。

0 人收藏 0 人点赞
#credit-assignment

反向传播的替代方案:Augmented Lagrangian Predictive Coding

Hacker News Top ↗ · 2026-09-14 缓存

PC-ALM 是一种局部训练方法,通过层局部动态系统传播监督信用,使得训练多达1000层的网络无需反向传播成为可能,同时性能几乎与反向传播相当。

0 人收藏 0 人点赞
#credit-assignment

面向长期LLM智能体强化学习的粒度自适应信用分配

arXiv cs.LG ↗ · 2026-09-14 缓存

本文提出了GACA,一种粒度自适应的信用分配方法,用于长期LLM智能体强化学习,通过适应分辨率到步骤重要性来提高任务成功率。

0 人收藏 0 人点赞
#credit-assignment

TIGPO:用于长视域LLM智能体的时间实例图策略优化

arXiv cs.LG ↗ · 2026-09-04 缓存

TIGPO提出了一种时间实例图策略优化方法,通过持久转移图和重访槽,扩展了基于图的信用分配跨策略更新,用于长视域LLM智能体,以改善优势估计和在ALFWorld和WebShop等基准测试上的性能。

0 人收藏 0 人点赞
#credit-assignment

PGPO:面向多轮智能体任务的势引导策略优化

arXiv cs.AI ↗ · 2026-09-03 缓存

PGPO 提出势引导策略优化用于多轮智能体任务,使得在 LLM 后训练中实现更细粒度的信用分配,并在 ALFWorld 和 WebShop 基准测试上展示出强劲结果。

0 人收藏 0 人点赞
#credit-assignment

MASkills:多智能体LLM系统的持续技能优化

arXiv cs.AI ↗ · 2026-09-03 缓存

MASkills 提出了一个持续学习框架,通过智能体技能优化多智能体LLM系统,使用基于技能的信用分配和层次聚合来提升在 HotpotQA 和 GAIA 等任务上的性能。

0 人收藏 0 人点赞
#credit-assignment

CHIME: 用于长时域代理规划的信用感知分层记忆演化

arXiv cs.AI ↗ · 2026-09-03 缓存

CHIME是一种信用感知分层记忆框架,它分离规划和执行记忆库,通过准确归因任务结果来提高长时域代理规划,并优于基线方法。

0 人收藏 0 人点赞
#credit-assignment

DRACO:基于动态评分标准的细粒度信用分配,用于长期代理训练

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

DRACO是一种强化学习方法,通过动态生成评分标准并重新分配轨迹分数来提升长期代理的性能,无需使用验证器。

0 人收藏 0 人点赞
#credit-assignment

CDPR:基于反事实优势的信用分配方法在成本感知序列医疗诊断中的应用

arXiv cs.AI ↗ · 2026-09-01 缓存

CDPR是一种基于反事实优势的信用分配方法,用于通过强化学习训练成本感知的序列医疗诊断模型,在提高诊断准确性的同时减少检查成本和数量。

0 人收藏 0 人点赞
#credit-assignment

@rohanpaul_ai: 这篇论文展示了训练多轮代理的更好方法:为每轮单独评分,然后使用自我教师来集中注意力……

X AI KOLs Following ↗ · 2026-08-31 缓存

该论文介绍了CREST,一种通过为每轮分配独立信用并使用自我教师来集中学习而不覆盖奖励的方法,以改善多轮代理训练,并在基准测试中展示性能提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈