标签
本文介绍了CoCoEvolve,一种自监督方法,通过在表示之间强制实现一一对应的一致性,提升跨图表、表格和代码的跨表示理解,并具有训练时和测试时的协同演化目标。
CURV 提出了一种课程学习框架,通过在多模态大语言模型中培养内在的视觉基础推理能力来增强图表问答,在真实世界基准上取得了显著改进。
一个4B开源模型在 CharXiv 图表理解基准上击败了 Mythos 5,展示了可自由获取的小模型的强大性能。
MIT研究人员开发了ChartNet,这是一个包含超过一百万张图表的数据集,用于训练视觉语言模型更准确地解读图表。他们的开源模型在图表理解任务上表现优于规模大得多的商业模型。
HakushoBench是一个基于政府白皮书构建的日语图表和表格VQA基准,用于评估视觉语言模型对复杂视觉数据的理解能力。该基准对开源权重模型具有挑战性,最佳准确率仅为58.6%,与专有模型之间相差34.9个百分点。