Tag
This paper proposes a method to extract an executable Prolog program from a deep reinforcement learning policy, providing theoretical guarantees on return and fidelity, enabling interpretability and manual editing.