SciForma:科学图表的结构忠实生成
摘要
介绍了SciForma,一个用于生成具有高结构保真度的科学方法图表的框架,使用多维联合偏好优化(M-DPO)和结构清单来确保在组件、箭头和文本轴上的正确性。该9B模型在基准评估上超越了开源基线和GPT-Image-1.5。
查看缓存全文
缓存时间: 2026/07/22 06:41
论文页面 - SciForma: 科学示意图的结构保真生成
来源:https://huggingface.co/papers/2607.18091
摘要
结构保真度对于科学方法示意图至关重要。为了传达研究逻辑,这些示意图必须忠实地呈现组件、方向关系以及文本标注。由于单个错误(例如箭头方向颠倒或方程难以辨认)就足以使整张图失效,结构保真度本质上是合取性的:在一个维度上的正确性无法弥补另一维度的失败。当前的开源模型无法满足这一标准。有监督微调(SFT)虽然能学习合理的布局,但无法可靠地保证结构正确性;而基于标量奖赏的后训练则模糊了究竟是哪个结构维度出现了问题。为解决这一问题,我们提出 SciForma,一个用于科学方法示意图结构保真生成的框架。具体而言,SciForma 将示意图质量分解为三个结构轴:组件、箭头和文本,并由一个结构清单引导。在此基础之上,我们构建了用于结构化训练的 SciFormaData-700K 和用于逻辑验证评估的 SciFormaBench-2K。为弥补 SFT 留下的差距,我们开发了多维合取偏好优化(M-DPO),它强制所有轴同时正确,并在后训练中自适应地将梯度路由到最薄弱的维度。同样的结构清单还使得推理时能够通过迭代编辑来纠正残留错误。这种组合使得 SciForma-9B 在 SciFormaBench-2K 和 AIBench 上均超越了所有开源基线以及 GPT-Image-1.5,将开放科学示意图生成的水平提升到接近专有级别的结构保真度。我们的代码和数据将在 https://github.com/microsoft/SciForma 提供。
查看 arXiv 页面 (https://arxiv.org/abs/2607.18091)查看 PDF (https://arxiv.org/pdf/2607.18091)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18091)
在你的 agent 中获取此论文:
hf papers read 2607.18091
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.18091 以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.18091 以从此页面链接。
引用此论文的 Space0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.18091 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
SCAFFOLD:用于计算机科学研究图表的包含图表问答和思维链推理轨迹的大规模结构化数据集
SCAFFOLD 是一个大规模的计算机科学研究图表数据集,配有标题、上下文、问答和思维链轨迹,旨在提高视觉语言模型对计算机科学论文中图表的理解。
MathForm: 通过知识检索和验证引导优化来扩展数学自动形式化
MathForm引入了一个利用知识检索和验证引导优化的数学自动形式化框架,产生了FormalVerse数据集和一个8B模型,该模型在性能上优于专业基线模型。
Crafter:一种面向多输入的可编辑科学图表生成的多智能体框架
本文介绍了Crafter,一种用于从多种输入类型生成可编辑科学图表的多智能体框架,以及用于光栅图到SVG转换的CraftEditor和用于评估的CraftBench,其性能优于现有的独立生成器。
PaperBanana-Interact:基于多轮人类反馈的科学图表优化
本文提出了一个基准和一个多智能体系统,旨在通过多轮人类反馈改进科学图表生成,解决了质量漂移和跨修订遗忘等问题。
FaithformBench:数学思维链自动形式化的忠实度基准
介绍了FaithformBench,一个用于评估数学思维链自动形式化系统忠实度的基准,通过测量扰动步骤上的有效性与无效性保持来评估。应用于八个AF系统后,揭示了普遍的“谄媚”现象,即无效输入被静默纠正。