multilingual-evaluation

Tag

Cards List
#multilingual-evaluation

Skill Issue: Are Skills Language-Invariant in LLMs?

Hugging Face Daily Papers · 3d ago Cached

This paper quantifies cross-lingual skill inconsistencies in large language models through multilingual self-play in text-based games, revealing significant variations in performance across languages that can be partially mitigated by altering intermediate reasoning language.

0 favorites 0 likes
#multilingual-evaluation

HealMed: Multilingual Evaluation of Large Language Models in Medicine

arXiv cs.CL · 2026-08-21 Cached

HealMed is an expert-reviewed benchmark for evaluating large language models in medicine across nine languages, developed by medical experts to assess multilingual performance in clinical tasks.

0 favorites 0 likes
#multilingual-evaluation

Where Does Retrieval Fail? Evaluating RAG Architectures for Agricultural Advisory

arXiv cs.CL · 2026-08-18 Cached

This paper evaluates retrieval quality in RAG systems for Bengali agricultural advisory, finding performance varies by query type and language conditions, and introduces a benchmark dataset to highlight the need for disaggregated evaluation in low-resource settings.

0 favorites 0 likes
#multilingual-evaluation

UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning

arXiv cs.CL · 2026-05-29 Cached

Introduces UA-Legal-Bench, a five-task benchmark for evaluating large language models on Ukrainian legal reasoning, built from the Unified State Register of Court Decisions. Evaluates 11 LLMs, revealing task-dependent few-shot effects and the misleading nature of accuracy on imbalanced legal tasks.

0 favorites 0 likes
#multilingual-evaluation

The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models

arXiv cs.CL · 2026-04-23 Cached

GaoYao introduces a 182k-sample benchmark across 26 languages and 51 regions to systematically evaluate LLMs’ multilingual and multicultural capabilities, revealing large geographical performance gaps.

0 favorites 0 likes
← Back to home

Submit Feedback