policy-optimization

Tag

Cards List
#policy-optimization

@Ankur_Samanta_: New work on credit assignment in multi-step reasoning RL post-training Introducing Self-Reset Policy Optimization (SRPO…

X AI KOLs Timeline · 2026-06-22 Cached

Self-Reset Policy Optimization (SRPO) addresses credit assignment in multi-step reasoning RL post-training by localizing the first wrong reasoning step and learning from counterfactual continuations without external supervision.

0 favorites 0 likes
#policy-optimization

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

Hugging Face Daily Papers · 2026-06-22 Cached

DR-MV3D presents a map-grounded learning framework with dense rewards to improve multi-view 3D visual question answering through global map construction, view-trajectory planning, and egocentric grounding.

0 favorites 0 likes
#policy-optimization

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

Hugging Face Daily Papers · 2026-06-21 Cached

PolicyTrim is a reinforcement learning-based post-training framework that improves action chunk utilization by 3× and reduces physical execution steps by 51.4% in Vision-Language-Action models, delivering up to 5.83× deployment speedup.

0 favorites 0 likes
#policy-optimization

Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

arXiv cs.AI · 2026-06-20 Cached

Introduces Independent Combinatorial Tokens (ICT) framework that uses Jensen-Shannon divergence between token logit distributions to identify critical branching points, preventing entropy collapse and explosion in RLVR for LLM reasoning. Achieves up to 14.9% pass@4 improvement on Qwen models.

0 favorites 0 likes
#policy-optimization

Revisiting Hard Questions with Replay Buffers (8 minute read)

TLDR AI · 2026-06-19 Cached

ZPPO introduces a replay buffer for hard questions in reinforcement learning for LLMs/VLMs, allowing repeated exposure to gradually improve rollout accuracy without policy drift. The method graduates more hard questions than GRPO, especially those with near-zero initial accuracy.

0 favorites 0 likes
#policy-optimization

GraphPO: Graph-based Policy Optimization for Reasoning Models

arXiv cs.CL · 2026-06-18 Cached

GraphPO is a novel graph-based reinforcement learning framework that represents rollouts as a directed acyclic graph, merging semantically equivalent reasoning paths to reduce redundant exploration and improve credit assignment for large reasoning models.

0 favorites 0 likes
#policy-optimization

MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization

Hugging Face Daily Papers · 2026-06-18 Cached

MobileForge presents an annotation-free adaptation system for mobile GUI agents that uses real app interaction and hierarchical feedback-guided policy optimization to improve performance, achieving near state-of-the-art results on AndroidWorld with open data.

0 favorites 0 likes
#policy-optimization

@FinanceYF5: ENPIRE can now independently perform high-precision operations such as zip-tying, sorting fine needles, and installing GPUs, and has demonstrated a 'physical scaling' phenomenon: multiple robots exploring in parallel, with significantly faster progress. Part of the NVIDIA GEAR lab can now self-improve overnight, with humans only needing to review reports in the morning. The project will also be open-sourced. It...

X AI KOLs Following · 2026-06-17 Cached

NVIDIA GEAR lab introduces ENPIRE, a framework for autonomous real-world robot policy self-improvement that achieves 99% success on dexterous manipulation tasks like GPU insertion and zip-tying, with multi-robot parallel learning and open-source release.

0 favorites 0 likes
#policy-optimization

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

Hugging Face Daily Papers · 2026-06-17 Cached

This paper proposes Trajectory-Augmented Policy Optimization (TAPO), which constructs micro-reflective correction trajectories using the model's own correct and incorrect rollouts to improve reasoning in large language models, outperforming standard self-distillation methods on math benchmarks.

0 favorites 0 likes
#policy-optimization

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

Hugging Face Daily Papers · 2026-06-17 Cached

Proposes REVES, a two-stage iterative framework that alternates between data augmentation and policy optimization to improve LLM reasoning by leveraging intermediate correction steps, achieving superior performance on coding benchmarks and constraint satisfaction problems.

0 favorites 0 likes
#policy-optimization

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

Hugging Face Daily Papers · 2026-06-16 Cached

Zone of Proximal Policy Optimization (ZPPO) improves knowledge distillation by using reformulated prompts that help students learn from both correct and incorrect responses, enhancing performance especially at smaller model sizes.

0 favorites 0 likes
#policy-optimization

GAGPO: Generalized Advantage Grouped Policy Optimization

arXiv cs.AI · 2026-06-15 Cached

GAGPO proposes a critic-free RL method that uses a non-parametric grouped value proxy for step-level credit assignment in multi-turn agentic tasks, outperforming strong baselines on ALFWorld and WebShop.

0 favorites 0 likes
#policy-optimization

CSPO: Constraint-Sensitive Policy Optimization for Safe Reinforcement Learning

arXiv cs.AI · 2026-06-15 Cached

This paper proposes Constraint-Sensitive Policy Optimization (CSPO), a first-order primal-dual method for safe reinforcement learning that incorporates local constraint sensitivity to improve safety recovery and reduce oscillations near safety boundaries, achieving higher constrained returns on navigation and locomotion benchmarks.

0 favorites 0 likes
#policy-optimization

Utility-Constrained Policy Optimization

arXiv cs.LG · 2026-06-15 Cached

This paper introduces a simple yet powerful methodology for Utility-Constrained MDPs (UCMDPs) that enables risk-sensitive constraints without fixing constraint limits in advance, outperforming baselines on Safety Gymnasium benchmarks.

0 favorites 0 likes
#policy-optimization

A Gradient Perspective on RLVR Stability and Winner Advantage Policy Optimization

Hugging Face Daily Papers · 2026-06-15 Cached

This paper analyzes token-level gradient dynamics in RLVR training, revealing how advantage sign and token probability jointly affect update stability, and introduces Winner Advantage Policy Optimization (WAPO) which performs clipped updates only on positive-advantage completions to improve stability.

0 favorites 0 likes
#policy-optimization

GD^2PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

Hugging Face Daily Papers · 2026-06-15 Cached

GD^2PO introduces a conflict-aware filtering mechanism to mitigate multi-reward conflicts in reinforcement learning for large language models, preventing signal cancellation and accelerating training efficiency.

0 favorites 0 likes
#policy-optimization

Mental-R1: Aligning LLM Reasoning for Mental Health Assessment

arXiv cs.AI · 2026-06-12 Cached

Proposes Cognitive Relative Policy Optimization (CRPO), a reinforcement learning framework for aligning LLM reasoning in mental health assessment, achieving an average improvement of 10.4 percentage points in weighted F1-score over existing baselines.

0 favorites 0 likes
#policy-optimization

IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

arXiv cs.LG · 2026-06-11 Cached

This paper introduces IAPO, a reinforcement learning algorithm that improves tool-calling capabilities in multimodal small language models by aligning input attribution with a stronger teacher. Experiments on Qwen2.5-VL-3B show an average 3% improvement in visual question answering accuracy across six test sets.

0 favorites 0 likes
#policy-optimization

APPO: Agentic Procedural Policy Optimization

Hugging Face Daily Papers · 2026-06-10 Cached

APPO improves multi-turn tool-use in LLM agents by refining branching decisions and credit assignment using fine-grained decision points and procedure-level advantage scaling, outperforming baselines by 4 points on 13 benchmarks.

0 favorites 0 likes
#policy-optimization

SocraticPO: Policy Optimization via Interactive Guidance

arXiv cs.LG · 2026-06-10 Cached

SocraticPO augments RL rollouts with Socratic-style natural language guidance and reward decay to improve scientific reasoning in LLMs, outperforming strong baselines on SciKnowEval benchmarks.

0 favorites 0 likes
← Previous
Next →
← Back to home

Submit Feedback