Tag
This paper evaluates open-weight large language models for PDDL domain repair in AI planning, showing they outperform symbolic baselines but struggle with reliable test constraint satisfaction.