combinatorial-counting

Tag

Cards List
#combinatorial-counting

CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

arXiv cs.AI · 2026-06-20 Cached

CombEval is a dynamic benchmark for evaluating combinatorial counting in large language models, using typed specifications to generate problems with solver-verified answers. It tests 11 LLMs under direct and code-augmented settings and finds brittleness on ordered objects, indistinguishable elements, relative constraints, and nested dependencies.

0 favorites 0 likes
← Back to home

Submit Feedback