op-policy-learning

Tag

Cards List
#op-policy-learning

Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

Hugging Face Daily Papers ↗ · 2026-09-27 Cached

This paper introduces AlignOPSD to address decision-timestamp mismatch in on-policy self-distillation for long-horizon agents, improving performance on benchmarks like ALFWorld, WebShop, and Search-QA compared to baselines.

0 favorites 0 likes
← Back to home

Submit Feedback