multimodal-benchmark

标签

Cards List
#multimodal-benchmark

Holtercare-Bench:一个评估长期动态心电图分析的多模态基准

arXiv cs.LG · 14小时前 缓存

Holtercare-Bench是一个多模态基准,用于使用Holtercare-23K数据集评估长期动态心电图分析,揭示了当前MLLMs的性能差距,并通过微调为临床应用提供改进。

0 人收藏 0 人点赞
#multimodal-benchmark

MCBench: 面向全模态大语言模型的多语境安全评估基准

arXiv cs.CL · 2026-06-05 缓存

MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。

0 人收藏 0 人点赞
#multimodal-benchmark

Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准

Hugging Face Daily Papers · 2026-06-04 缓存

BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。

0 人收藏 0 人点赞
#multimodal-benchmark

KMMMU:韩语及韩国文化背景下的大规模多学科多模态理解评估

arXiv cs.CL · 2026-04-20 缓存

KMMMU 是一个用于评估韩语多模态理解的本地化韩文基准,包含 3,466 道题目,涵盖九个学科和视觉模态类别,通过测试韩国特定文化和制度背景下的性能,填补了以英文为中心的基准的空白。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈