policy-optimization

Tag

Cards List
#policy-optimization

DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

arXiv cs.AI ↗ · 21h ago Cached

The paper proposes DEEPO, a dual-stage reinforcement learning optimization method to reduce hallucination in multimodal large language models by addressing weaknesses in the correction chain from reward to parameter update.

0 favorites 0 likes
#policy-optimization

Reinforcement Learning with Decomposed Subtasks

arXiv cs.AI ↗ · yesterday Cached

This paper introduces Reinforcement Learning with Decomposed Subtasks (RLDS), a method that decomposes trajectory reward into per-subtask advantages to improve credit assignment in reinforcement learning for language model agents, showing significant gains on high-heterogeneity agentic benchmarks.

0 favorites 0 likes
#policy-optimization

Beyond Task Completion: Training Capable and Safe Computer-Use Agents

arXiv cs.LG ↗ · 3d ago Cached

This paper introduces SCOPE, a joint training method for computer-use agents that improves both task completion and safety, using a synthesized dataset and achieving strong performance on benchmarks OSWorld and OS-BLIND.

0 favorites 0 likes
#policy-optimization

GVPO++: Group Variance Policy Optimization for LLM Post-Training and On-Policy Distillation

arXiv cs.AI ↗ · 4d ago Cached

This paper introduces GVPO++, a novel post-training method for large language models that integrates KL-constrained reward maximization, enhancing training stability and enabling on-policy distillation.

0 favorites 0 likes
#policy-optimization

DAPO: An Open-Source RL System from ByteDance Seed and Tsinghua Air

Hacker News Top ↗ · 5d ago Cached

DAPO is an open-source reinforcement learning system for large language models, developed by ByteDance Seed and Tsinghua AIR, which achieves state-of-the-art performance on the AIME 2024 benchmark with the Qwen2.5-32B model.

0 favorites 0 likes
#policy-optimization

RewardVerse: Rubric-Guided Policy Optimization for Video Reward Modeling

Hugging Face Daily Papers ↗ · 2026-09-19 Cached

RewardVerse presents a rubric-based framework for video reward modeling to mitigate scalar drift and provide stable evaluation criteria, enhancing reinforcement learning in video generation.

0 favorites 0 likes
#policy-optimization

Dual-Axis Policy Optimization for LLM Agents: Bayesian Feedback Attribution and Trajectory Mass Normalization

arXiv cs.AI ↗ · 2026-09-18 Cached

The paper introduces BATON, a dual-axis policy optimization framework for LLM agents using Bayesian Feedback Attribution and Trajectory Mass Normalization, demonstrating improved performance in reinforcement learning experiments.

0 favorites 0 likes
#policy-optimization

Steering Equilibrium Selection in Regularized Self-Play via the Reference Policy

arXiv cs.AI ↗ · 2026-09-18 Cached

This research paper explores using a reference policy to deliberately steer equilibrium selection in regularized self-play for two-player zero-sum games, providing experimental results and theoretical analysis on tractable games.

0 favorites 0 likes
#policy-optimization

Anchoring What Matters: A Dual-Level Learning Framework for Visually-Grounded Multimodal Reasoning

arXiv cs.AI ↗ · 2026-09-17 Cached

This paper proposes PIVOT, a dual-level learning framework that enhances visually-grounded reasoning in large vision-language models by using self-calibrated experience replay and vision-guided advantage allocation to optimize reinforcement learning.

0 favorites 0 likes
#policy-optimization

TIAO: Token Importance-Aware Policy Optimization for Text Summarization

arXiv cs.CL ↗ · 2026-09-16 Cached

TIAO is a token importance-aware reinforcement learning strategy for text summarization that reweights trajectories based on token dependencies, achieving results comparable to GPT-4 and GPT-5-nano on real-world datasets.

0 favorites 0 likes
#policy-optimization

EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents

Hugging Face Daily Papers ↗ · 2026-09-15 Cached

EvolveTrade introduces a self-evolving framework for LLM trading agents that refines tool-use policies using decision traces and portfolio feedback, improving Sharpe Ratio and cumulative returns across market regimes.

0 favorites 0 likes
#policy-optimization

Bellman Policy Optimization

Hugging Face Daily Papers ↗ · 2026-09-14 Cached

Bellman Policy Optimization (BPO) is a critic-free reinforcement learning method that reformulates Policy Mirror Descent using the Bellman equation for autoregressive generation with terminal rewards, improving mathematical reasoning in large language models.

0 favorites 0 likes
#policy-optimization

Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection

arXiv cs.AI ↗ · 2026-09-11 Cached

The paper introduces FGPO, a method for exact policy optimization in genomic tool selection that enumerates all possible tool subsets to outperform sampling-based approaches like GRPO.

0 favorites 0 likes
#policy-optimization

VERPO: Verified Evidence Regularized Policy Optimization

arXiv cs.LG ↗ · 2026-09-10 Cached

VERPO introduces a framework for verified evidence regularized policy optimization in language models, improving performance on scientific reasoning and tool-use tasks by treating evidence as a proposal for policy correction while maintaining outcome objectives.

0 favorites 0 likes
#policy-optimization

Difficulty-Adaptive Tree-Structured Policy Optimization for Expanding Reasoning Coverage in RLVR

Hugging Face Daily Papers ↗ · 2026-09-08 Cached

The paper proposes DATPO, a difficulty-adaptive tree-structured policy optimization method that enhances reasoning coverage in large models through sentence-entropy-guided branching and diversity-aware optimization, outperforming baselines in pass@k metrics.

0 favorites 0 likes
#policy-optimization

@wenhaocha1: Really like this figure!

X AI KOLs Timeline ↗ · 2026-09-07 Cached

A developer discusses why tail reinforcement learning remains effective even when the initial policy lacks good coverage of target behaviors.

0 favorites 0 likes
#policy-optimization

TIGPO: Temporal Instance-Graph Policy Optimization for Long-Horizon LLM Agents

arXiv cs.LG ↗ · 2026-09-04 Cached

TIGPO proposes a temporal instance-graph policy optimization method that extends graph-based credit assignment across policy updates for long-horizon LLM agents, using persistent transition graphs and revisit slots to improve advantage estimation and performance on benchmarks like ALFWorld and WebShop.

0 favorites 0 likes
#policy-optimization

DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation

arXiv cs.LG ↗ · 2026-09-03 Cached

DMRL is a Document-Mediated Reinforcement Learning framework that optimizes skill documents for advertising recommendation using structured editing actions, policy optimization, and long-term reward prediction, demonstrating improved performance over baselines in large-scale deployment.

0 favorites 0 likes
#policy-optimization

PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks

arXiv cs.AI ↗ · 2026-09-03 Cached

PGPO proposes potential-guided policy optimization for multi-turn agentic tasks, enabling finer-grained credit assignment in LLM post-training and showing strong results on ALFWorld and WebShop benchmarks.

0 favorites 0 likes
#policy-optimization

Group Adaptive Clipping Policy Optimization

arXiv cs.LG ↗ · 2026-09-02 Cached

The paper proposes Group Adaptive Clustering Policy Optimization (GAPO), a plug-in modification to GRPO methods that adapts the clipping boundary to rollout advantage, improving Pass@1 and Pass@k on math reasoning and coding benchmarks.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback