conditional-policies

Tag

Cards List
#conditional-policies

Demonstrating Generalization Failures via Mixtures of Conditional Policies

arXiv cs.AI · 2026-07-07 Cached

This paper proposes a method to construct language models that exhibit controllable generalization failures when trained with reinforcement learning, demonstrating that training success can diverge from generalization in structured ways.

0 favorites 0 likes
← Back to home

Submit Feedback