Tag
This paper presents a human-centred benchmarking approach for evaluating large language models in parenting advice, assessing 15 LLMs across 100 scenarios in English and Chinese using expert-derived rubrics.