policy-optimization

Tag

Cards List
#policy-optimization

RICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning Agents

arXiv cs.CL · 2026-05-27 Cached

RICE-PO is a critic-free policy optimization framework that turns retrieval interactions into localized credit signals for training reasoning agents, outperforming prompt-based and group-based RL baselines on BRIGHT and BEIR benchmarks.

0 favorites 0 likes
#policy-optimization

Generative OOD-regularized Model-based Policy Optimization

arXiv cs.LG · 2026-05-26 Cached

Introduces GORMPO, a density-regularized offline RL algorithm that uses generative density modeling to restrict policy updates to high-density areas, achieving 17% improvement on a real-world medical dataset and outperforming state-of-the-art baselines.

0 favorites 0 likes
#policy-optimization

Not only where, But when: Temporal Scheduling for RLVR

Hugging Face Daily Papers · 2026-05-25 Cached

Introduces temporal scheduling for credit allocation criteria in reinforcement learning with verifiable rewards, showing that scheduling when learning signals are applied improves policy evolution and stability.

0 favorites 0 likes
#policy-optimization

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

Reddit r/LocalLLaMA · 2026-05-22 Cached

This paper introduces Vector Policy Optimization (VPO), a reinforcement learning algorithm that trains LLMs to produce diverse solutions by optimizing across multiple reward dimensions, significantly improving test-time search performance compared to scalar RL baselines.

0 favorites 0 likes
#policy-optimization

@ishapuri101: It's never made sense to me that RL collapses all reward signals to a single scalar. Today, we fix that! Introducing Ve…

X AI KOLs Timeline · 2026-05-22 Cached

Introduces Vector Policy Optimization (VPO) to train models with vector-valued rewards instead of scalar rewards, enabling diverse answer sets for test-time search.

0 favorites 0 likes
#policy-optimization

TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

arXiv cs.LG · 2026-05-20

Proposes TEMPO, a policy optimization method that trains LLMs to reason exclusively from pre-cutoff information by using a two-mode reward and GRPO-based training, reducing knowledge leakage by 2–13% while improving task performance by 6–13%.

0 favorites 0 likes
#policy-optimization

LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models

arXiv cs.CL · 2026-05-20 Cached

Introduces LambdaPO, a novel reinforcement learning framework that improves upon GRPO by decomposing advantage estimation into pairwise preference comparisons and adding a semantic density reward, achieving better performance on math reasoning tasks.

0 favorites 0 likes
#policy-optimization

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

arXiv cs.LG · 2026-05-19 Cached

This paper identifies weaknesses in existing reinforcement learning methods for diffusion language models—lack of temporal credit assignment and biased likelihood estimates—and proposes DACA-GRPO, a plug-and-play enhancement that introduces denoising progress scores and stratified masking likelihood, achieving consistent improvements across reasoning, code generation, and constrained generation benchmarks.

0 favorites 0 likes
#policy-optimization

Reducing Credit Assignment Variance via Counterfactual Reasoning Paths

arXiv cs.LG · 2026-05-19 Cached

Introduces Implicit Behavior Policy Optimization (IBPO), a counterfactual comparison-based credit assignment framework that improves training stability and performance in multi-step reasoning tasks for large language models by converting sparse terminal rewards into step-sensitive learning signals.

0 favorites 0 likes
#policy-optimization

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

Hugging Face Daily Papers · 2026-05-19 Cached

CEPO improves reinforcement learning with verifiable rewards by using contrastive signals from rejected rollouts to distinguish decisive reasoning steps from filler tokens, achieving higher accuracy on multimodal math reasoning benchmarks compared to GRPO.

0 favorites 0 likes
#policy-optimization

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

arXiv cs.CL · 2026-05-15 Cached

Proposes Correction-Oriented Policy Optimization (CIPO), an extension to RLVR that converts failed trajectories into correction-oriented supervision, improving reasoning and correction performance in LLMs across math and code benchmarks.

0 favorites 0 likes
#policy-optimization

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

Hugging Face Daily Papers · 2026-05-15 Cached

Flash-GRPO improves training efficiency for video diffusion models by addressing temporal variance and gradient inconsistency through iso-temporal grouping and temporal gradient rectification, achieving state-of-the-art alignment quality with substantial training acceleration.

0 favorites 0 likes
#policy-optimization

ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

arXiv cs.LG · 2026-05-14 Cached

Introduces ODRPO, a framework that decomposes discrete rewards into ordinal binary indicators to improve robustness of policy optimization in RLAIF for LLMs, achieving up to 14.8% relative improvement with minimal overhead.

0 favorites 0 likes
#policy-optimization

TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

arXiv cs.LG · 2026-05-13 Cached

This paper introduces Trajectory Matching Policy Optimization (TMPO), a method for aligning diffusion models that addresses reward hacking and visual mode collapse by matching trajectory-level reward distributions rather than maximizing scalar rewards.

0 favorites 0 likes
#policy-optimization

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

arXiv cs.CL · 2026-05-13 Cached

This paper proposes a covariance-aware variant of Group Relative Policy Optimization (GRPO) that uses Gaussian-kernel advantage reweighting to stabilize training entropy and improve reasoning performance in large language models.

0 favorites 0 likes
#policy-optimization

Hölder Policy Optimisation

Hugging Face Daily Papers · 2026-05-12 Cached

HölderPO introduces a generalized policy optimization framework that uses the Hölder mean for token-level probability aggregation in GRPO, with a dynamic annealing schedule to balance gradient concentration and variance. The method achieves state-of-the-art results on mathematical benchmarks (54.9% average, 7.2% relative gain over GRPO) and a 93.8% success rate on ALFWorld.

0 favorites 0 likes
#policy-optimization

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

Hugging Face Daily Papers · 2026-05-12 Cached

This paper proposes an exploration-aware reinforcement learning framework that enables LLM agents to adaptively explore only when uncertainty is high, improving performance on text-based and GUI-based benchmarks.

0 favorites 0 likes
#policy-optimization

Structured Role-Aware Policy Optimization for Multimodal Reasoning

arXiv cs.AI · 2026-05-11 Cached

This paper introduces Structured Role-Aware Policy Optimization (SRPO), a method that improves multimodal reasoning in Large Vision-Language Models by assigning token-level credit based on distinct perception and reasoning roles within reinforcement learning frameworks.

0 favorites 0 likes
#policy-optimization

Gradient Extrapolation-Based Policy Optimization

arXiv cs.LG · 2026-05-11 Cached

The article introduces Gradient Extrapolation-Based Policy Optimization (GXPO), a method that approximates multi-step lookahead in RL training for LLMs using only three backward passes. It demonstrates improved reasoning performance on math benchmarks over standard GRPO while maintaining fixed active-phase costs.

0 favorites 0 likes
#policy-optimization

Unsupervised Process Reward Models

Hugging Face Daily Papers · 2026-05-11 Cached

This paper proposes unsupervised Process Reward Models (uPRM) that eliminate the need for human annotations by using LLM next-token probabilities to identify erroneous reasoning steps, achieving up to 15% accuracy improvements over LLM-as-a-Judge and performing comparably to supervised PRMs as verifiers and reward signals.

0 favorites 0 likes
← Previous
Next →
← Back to home

Submit Feedback