CLBench-V: 从上下文基础到知识获取的多模态上下文学习评估

Hugging Face Daily Papers 论文

摘要

CLBench-V是一个用于评估多模态上下文学习的基准,涵盖上下文基础、新信息应用和新知识学习。最佳模型仅达到0.2847,表明该任务仍然具有挑战性。

真实世界的任务通常要求模型从任务特定的上下文中学习,而不仅仅依赖预训练知识。尽管近期研究将这种能力称为上下文学习,但现有评估主要聚焦于文本上下文。然而,在许多实际场景中,需要学习的上下文是多模态的:科学发现通过图表传达,财务指标分散在转换后的报告中,空间决策依赖于地图、场景或网页。我们引入了CLBench-V,这是一个用于评估多模态上下文学习的基准,它通过围绕三个维度组织任务来解决定位上下文使用失效处的困难:上下文基础、新信息应用和新知识学习。CLBench-V结合了转换后的公开基准和新构建的数据集,涵盖科学、金融、长文档理解、空间推理和基于网页的视觉问答等领域。为降低构建特定领域上下文学习任务成本,我们进一步对新构建的数据集采用自动构建和过滤流程。在3,443个实例和六个近期多模态模型上,最佳总体得分仅为0.2847,表明多模态上下文学习远未饱和。此外,InternVL3.5-30B-A3B在上下文基础和新知识学习上表现最佳,而Qwen3.5-Plus在新信息应用上表现最佳。我们进一步分析了评估者可靠性、上下文长度、图像数量和代表性失败案例。代码可在https://github.com/IamLihua/CLBench-V获取。
查看原文
查看缓存全文

缓存时间: 2026/07/30 05:46

论文页面 - CLBench-V: 评估多模态情境学习从基础定位到知识获取

来源:https://huggingface.co/papers/2607.25294

摘要

现实世界中的任务通常要求模型从特定任务的情境中学习,而不是仅依赖预训练知识。虽然近期工作已将这种能力强调为情境学习,但现有评估主要聚焦于文本情境。然而,在许多实际场景中,需要学习的情境本身就是多模态的:科学发现通过图表和表格传达、财务指标散布在转换后的报告中、空间决策依赖于地图、场景或网页。我们提出 CLBench-V,一个用于多模态情境学习的基准测试,它通过围绕三个维度组织任务来解决定位情境学习失败点的难题:情境基础定位、新信息应用和新知识学习。CLBench-V 结合了转换后的公开基准测试与新构建的数据集,涵盖科学、金融、长文档理解、空间推理和基于网页的视觉问答等领域。为降低构建领域特定情境学习任务的成本,我们进一步对新建数据集使用自动化构建与过滤流程。在 3,443 个实例和六个最新多模态模型上,最佳总体得分仅为 0.2847,表明多模态情境学习远未饱和。此外,InternVL3.5-30B-A3B 在情境基础定位和新知识学习上表现最佳,而 Qwen3.5-Plus 在新信息应用上表现最佳。我们进一步分析了评判者可靠性、情境长度、图像数量以及典型失败案例。代码已公开在 https://github.com/IamLihua/CLBench-V。

查看 arXiv 页面 (https://arxiv.org/abs/2607.25294)查看 PDF (https://arxiv.org/pdf/2607.25294)GitHub1 (https://github.com/IamLihua/CLBench-V)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25294)

在您的 agent 中获取此论文:

hf papers read 2607.25294

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.25294 以在此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.25294 以在此页面链接。

引用此论文的 Spaces0

没有 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.25294 以在此页面链接。

包含此论文的收藏0

没有收藏包含此论文

请将此论文添加到收藏 (https://huggingface.co/new-collection) 以在此页面链接。

相似文章

IMCBench:面向图像基础医疗对话的多模态大语言模型基准

arXiv cs.AI

IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。