benchmark-training

Tag

Cards List
#benchmark-training

Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms

Hugging Face Daily Papers ↗ · 3d ago Cached

This paper introduces VHD-Play, a pipeline that generates diverse agentic reinforcement learning environments by first solving mathematical models, significantly improving training for language-model agents like Qwen3.6-35B-A3B at low cost and extending to external benchmarks.

0 favorites 0 likes
← Back to home

Submit Feedback