CLBench-V: 从上下文基础到知识获取的多模态上下文学习评估
摘要
CLBench-V是一个用于评估多模态上下文学习的基准,涵盖上下文基础、新信息应用和新知识学习。最佳模型仅达到0.2847,表明该任务仍然具有挑战性。
查看缓存全文
缓存时间: 2026/07/30 05:46
论文页面 - CLBench-V: 评估多模态情境学习从基础定位到知识获取
来源:https://huggingface.co/papers/2607.25294
摘要
现实世界中的任务通常要求模型从特定任务的情境中学习,而不是仅依赖预训练知识。虽然近期工作已将这种能力强调为情境学习,但现有评估主要聚焦于文本情境。然而,在许多实际场景中,需要学习的情境本身就是多模态的:科学发现通过图表和表格传达、财务指标散布在转换后的报告中、空间决策依赖于地图、场景或网页。我们提出 CLBench-V,一个用于多模态情境学习的基准测试,它通过围绕三个维度组织任务来解决定位情境学习失败点的难题:情境基础定位、新信息应用和新知识学习。CLBench-V 结合了转换后的公开基准测试与新构建的数据集,涵盖科学、金融、长文档理解、空间推理和基于网页的视觉问答等领域。为降低构建领域特定情境学习任务的成本,我们进一步对新建数据集使用自动化构建与过滤流程。在 3,443 个实例和六个最新多模态模型上,最佳总体得分仅为 0.2847,表明多模态情境学习远未饱和。此外,InternVL3.5-30B-A3B 在情境基础定位和新知识学习上表现最佳,而 Qwen3.5-Plus 在新信息应用上表现最佳。我们进一步分析了评判者可靠性、情境长度、图像数量以及典型失败案例。代码已公开在 https://github.com/IamLihua/CLBench-V。
查看 arXiv 页面 (https://arxiv.org/abs/2607.25294)查看 PDF (https://arxiv.org/pdf/2607.25294)GitHub1 (https://github.com/IamLihua/CLBench-V)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.25294)
在您的 agent 中获取此论文:
hf papers read 2607.25294
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.25294 以在此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.25294 以在此页面链接。
引用此论文的 Spaces0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.25294 以在此页面链接。
包含此论文的收藏0
没有收藏包含此论文
请将此论文添加到收藏 (https://huggingface.co/new-collection) 以在此页面链接。
相似文章
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
IMCBench:面向图像基础医疗对话的多模态大语言模型基准
IMCBench是一个新的基准,用于评估多模态大语言模型在图像基础医疗对话中的表现,它将临床图像与合成患者档案配对。在安全性、准确性和不确定性方面的评估表明,即使是像Claude Opus 4.6这样强大的模型也存在安全问题,凸显了多维度评估的必要性。
@omarsar0: // Continual Learning Bench // 持续学习是投入大量资金的研究领域之一。虽然存在…
CL-Bench 是一个经过专家验证的跨六个领域的新基准,用于评估基于LLM的智能体是否真正从序列经验中学习。它发现,朴素上下文学习往往优于专用的记忆系统,表明当前架构增加了开销而非真正的学习。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。