帮助图表讲述它们的故事!基于论文的视频生成,解释复杂的科学图表
摘要
介绍了 MINARD,一个从科学图表及其论文生成带旁白、区域定位的讲解视频的流水线,以及 FigTalk 基准和新的定位指标。
arXiv:2606.12576v1 Announce Type: new
摘要:科学图表将复杂的流程压缩到单个画布中,但理解它们需要基于论文、逐步讲解并与视觉高亮对齐的叙述——这是当前视频生成系统和基准所缺乏的能力。为解决这一问题,我们引入了基于论文的图表到视频生成:从图表及其论文生成带旁白、区域定位的讲解视频。我们提出了 MINARD(通过区域分解对叙述架构进行多模态解释),这是一个生成基于论文的叙述并依次将其与图表区域关联的流水线。我们还发布了 FigTalk 基准,该基准包含了新的序列级和组件级定位指标。在 FigTalk 上,MINARD 生成了类人且忠于论文的叙述,并在自动评估和人工评估中,在基于叙述的图表空间定位方面优于现有方法。
查看缓存全文
缓存时间: 2026/06/12 08:50
# 让图表讲述它们的故事!基于论文的视频生成解释复杂科学图表 来源:https://arxiv.org/abs/2606.12576 查看PDF (https://arxiv.org/pdf/2606.12576) > 摘要:科学图表将复杂流程压缩到单一画布上,但理解它们需要基于论文、逐步叙述并配合视觉高亮——这是当前视频生成系统和基准测试所缺失的能力。为解决这一问题,我们提出基于论文的图表到视频生成:从图表及其论文中生成带旁白、区域定位的导览视频。我们提出MINARD(通过区域分解实现叙述架构的多模态解析)流程,该流程可生成基于论文的旁白,并顺序将其关联到图表区域。我们还发布FigTalk基准,附带新的顺序性和组件级定位评估指标。在FigTalk上,MINARD生成的旁白拟人化且忠于论文,在自动评估和人工评估中,与现有方法相比,在旁白条件下的图表空间定位任务上表现更优 ## 提交历史 来自:Ishani Mondal [查看邮箱](https://arxiv.org/show-email/70f8b856/2606.12576) **[v1]** 2026年6月10日星期三 18:25:10 UTC(9,279 KB)
相似文章
视觉具象化推理
本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。
ReGround:基于多模态证据的审稿意见定位
ReGround 是一个大规模数据集,用于将审稿意见定位到科学论文的多模态证据上,揭示了在检索任务中整合文本、表格和图表的重要性和挑战性。
视频中定位万物:重新思考高效生成式时空视频定位
Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
从被动视频到可编辑体验:面向具身智能的物理接地体验合成
介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。