Tag
A paper compares 8 LLMs with over 18,000 human learners, finding that high accuracy in LLMs can hide disconnected foundational knowledge, and recommends evaluating with connected problem sets.