multimodal-evaluation

Tag

Cards List
#multimodal-evaluation

MemeCULT-1K: Benchmarking South Asian Cultural Context and Humor Understanding of Multimodal Models

arXiv cs.CL · 6d ago Cached

The paper introduces MemeCULT-1K, a multilingual benchmark of 1,000 South Asian memes to evaluate vision-language models' understanding of cultural context and humor, demonstrating that providing cultural context improves model performance.

0 favorites 0 likes
#multimodal-evaluation

MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators

arXiv cs.CL · 2026-08-20 Cached

This paper proposes MAVEN, a hierarchical framework for evaluating multimodal content against macro-societal values, featuring a benchmark and optimized evaluators for scalable assessment.

0 favorites 0 likes
#multimodal-evaluation

@yanawei_: Thanks AK for featuring our work! More details: http://weiyana.github.io/PerceptionRubrics…

X AI KOLs Following · 2026-07-03 Cached

Introduces PerceptionRubrics, a rubric-based evaluation framework for multimodal AI that shifts from holistic matching to atomic auditing using 1,038 images and over 10,000 instance-specific rubrics, with gated scoring to enforce strict perceptual fidelity.

0 favorites 0 likes
#multimodal-evaluation

MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

Hugging Face Daily Papers · 2026-04-20 Cached

Researchers introduce MM-JudgeBias, a benchmark that exposes systematic compositional biases in multimodal large language models when used as automatic judges, testing 26 SOTA MLLMs across 1,800 samples.

0 favorites 0 likes
← Back to home

Submit Feedback