credit-assignment

Tag

Cards List
#credit-assignment

CounterRoute: Self-Routed Reasoning via Hierarchical Counterfactual Credit Assignment

arXiv cs.AI ↗ · yesterday Cached

CounterRoute introduces an online reinforcement-learning framework that jointly learns routing and mode-conditioned responses in dual-mode language models, improving accuracy while reducing inference tokens.

0 favorites 0 likes
#credit-assignment

SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

arXiv cs.AI ↗ · yesterday Cached

SLCA-GRPO introduces Segment-Locked Credit Assignment to improve reinforcement learning for tool-calling agents by decoupling advantage estimation and using hierarchical rewards, leading to faster convergence and higher accuracy.

0 favorites 0 likes
#credit-assignment

Giving Credit Where It's Due: Redundancy-Aware Learning for Efficient Reasoning

arXiv cs.CL ↗ · 2d ago Cached

The paper introduces RECAP, a redundancy-aware learning method that improves the efficiency of large reasoning models by assigning credit to steps based on their structural role and efficacy, enhancing accuracy while reducing token usage.

0 favorites 0 likes
#credit-assignment

Reinforcement Learning with Decomposed Subtasks

arXiv cs.AI ↗ · 2d ago Cached

This paper introduces Reinforcement Learning with Decomposed Subtasks (RLDS), a method that decomposes trajectory reward into per-subtask advantages to improve credit assignment in reinforcement learning for language model agents, showing significant gains on high-heterogeneity agentic benchmarks.

0 favorites 0 likes
#credit-assignment

ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement

arXiv cs.LG ↗ · 2026-09-15 Cached

ReCAST proposes a method for per-reward, timestep-dependent credit assignment in diffusion model fine-tuning, separating user preferences from temporal allocation to improve alignment and informativeness.

0 favorites 0 likes
#credit-assignment

Backprop Alternative: Augmented Lagrangian Predictive Coding

Hacker News Top ↗ · 2026-09-14 Cached

PC-ALM is a local training method that uses layer-local dynamical systems to propagate supervision credit, enabling the training of up to 1000-layer networks without backpropagation while nearly matching its performance.

0 favorites 0 likes
#credit-assignment

Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

arXiv cs.LG ↗ · 2026-09-14 Cached

The paper proposes GACA, a granularity-adaptive credit assignment method for long-horizon LLM agent reinforcement learning that improves task success by adapting resolution to step importance.

0 favorites 0 likes
#credit-assignment

TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents

arXiv cs.LG ↗ · 2026-09-04 Cached

TIGPO proposes a temporal instance-graph policy optimization method that extends graph-based credit assignment across policy updates for long-horizon LLM agents, using persistent transition graphs and revisit slots to improve advantage estimation and performance on benchmarks like ALFWorld and WebShop.

0 favorites 0 likes
#credit-assignment

PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks

arXiv cs.AI ↗ · 2026-09-03 Cached

PGPO proposes potential-guided policy optimization for multi-turn agentic tasks, enabling finer-grained credit assignment in LLM post-training and showing strong results on ALFWorld and WebShop benchmarks.

0 favorites 0 likes
#credit-assignment

MASkills: Continual Skills Optimization for Multi-Agent LLM Systems

arXiv cs.AI ↗ · 2026-09-03 Cached

MASkills presents a continual learning framework that optimizes multi-agent LLM systems through agent skills, using skill-conditioned credit assignment and hierarchical aggregation to improve performance on tasks like HotpotQA and GAIA.

0 favorites 0 likes
#credit-assignment

CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning

arXiv cs.AI ↗ · 2026-09-03 Cached

CHIME is a credit-aware hierarchical memory framework that separates planning and execution memory banks to improve long-horizon agentic planning by accurately attributing task outcomes and outperforming baselines.

0 favorites 0 likes
#credit-assignment

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

Hugging Face Daily Papers ↗ · 2026-09-03 Cached

DRACO is a reinforcement learning method that dynamically generates rubrics and redistributes trajectory scores to improve long-horizon agent performance without verifiers.

0 favorites 0 likes
#credit-assignment

CDPR: Counterfactual Advantage-based Credit Assignment for Cost-Aware Sequential Medical Diagnosis

arXiv cs.AI ↗ · 2026-09-01 Cached

CDPR is a counterfactual advantage-based credit assignment method for training cost-aware sequential medical diagnosis models using reinforcement learning, improving accuracy while reducing examination costs and number.

0 favorites 0 likes
#credit-assignment

@rohanpaul_ai: This paper shows a better way to train multi-turn agents: score each turn separately, then use a self-teacher to focus …

X AI KOLs Following ↗ · 2026-08-31 Cached

The paper introduces CREST, a method to improve multi-turn agent training by assigning separate credits to each turn and using a self-teacher to focus learning without overriding rewards, showing performance gains on benchmarks.

0 favorites 0 likes
#credit-assignment

Contrastive Branch Policy Optimization

arXiv cs.LG ↗ · 2026-08-26 Cached

CBPO introduces a contrastive branch policy optimization method for fine-grained credit assignment in reinforcement learning with verifiable rewards, enhancing language model performance in tool-integrated reasoning tasks across multiple benchmarks.

0 favorites 0 likes
#credit-assignment

HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

arXiv cs.CL ↗ · 2026-08-25 Cached

Proposes HiDiffTIR, a hierarchical difficulty-aware policy optimization framework for multi-turn tool-integrated reasoning in LLM agents, improving performance and tool invocation accuracy through fine-grained credit assignment.

0 favorites 0 likes
#credit-assignment

Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning

arXiv cs.AI ↗ · 2026-08-25 Cached

The paper proposes computation-conditioned credit transport (CCT) and the CompPO algorithm for architecture-aware credit assignment in large language model reinforcement learning, showing improved performance over baselines like GRPO.

0 favorites 0 likes
#credit-assignment

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

arXiv cs.LG ↗ · 2026-08-21 Cached

MileGPO proposes a method for credit assignment in long-horizon LLM agents using milestone inference with local evidence, achieving state-of-the-art performance on ALFWorld and WebShop benchmarks.

0 favorites 0 likes
#credit-assignment

Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay

arXiv cs.LG ↗ · 2026-08-21 Cached

This paper audits step-level credit assignment in LLM agents using causal ground truth from executed replay, finding that common credit signals fail to identify causally important steps better than chance, with implications for training methods.

0 favorites 0 likes
#credit-assignment

Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context

arXiv cs.AI ↗ · 2026-08-19 Cached

This paper introduces Feedback-Aware Credit Assignment (Faca) to improve multi-turn tool-using language agents by using next-turn user reactions as local credit signals, showing significant performance gains on interactive benchmarks.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback