SciForma:科学图表的结构忠实生成

Hugging Face Daily Papers 论文

摘要

介绍了SciForma,一个用于生成具有高结构保真度的科学方法图表的框架,使用多维联合偏好优化(M-DPO)和结构清单来确保在组件、箭头和文本轴上的正确性。该9B模型在基准评估上超越了开源基线和GPT-Image-1.5。

结构保真度对于科学方法图表至关重要。为了传达研究逻辑,这些图表必须忠实地呈现组件、方向关系和文本注释。由于一个单一的错误,例如箭头反向或方程无法阅读,就可能导致整个图表无效,因此结构保真度本质上是联合的:一个轴上的正确性无法弥补另一个轴上的失败。当前的开源模型无法满足这一标准。监督微调(SFT)可以学习合理的布局,但无法可靠地确保结构正确性,而基于标量奖励的后训练则掩盖了哪个结构维度出现了故障。为解决这个问题,我们引入了SciForma,一个用于科学方法图表的结构忠实生成框架。具体而言,SciForma将图表质量分解为三个结构轴:组件、箭头和文本,并受结构清单指导。在此基础上,我们整理了SciFormaData-700K用于结构化训练,以及SciFormaBench-2K用于逻辑验证评估。为了弥补SFT留下的差距,我们开发了多维联合偏好优化(M-DPO),该优化强制在所有轴上同时正确,并在后训练中自适应地将梯度路由到最欠缺的维度。相同的结构清单还支持在推理时进行迭代编辑以纠正剩余错误。这种组合使SciForma-9B在SciFormaBench-2K和AIBench上均超越了所有开源基线和GPT-Image-1.5,将开放科学图表生成提升到接近专有级别的结构保真度。我们的代码和数据将在以下网址提供:https://github.com/microsoft/SciForma。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

论文页面 - SciForma: 科学示意图的结构保真生成

来源:https://huggingface.co/papers/2607.18091

摘要

结构保真度对于科学方法示意图至关重要。为了传达研究逻辑,这些示意图必须忠实地呈现组件、方向关系以及文本标注。由于单个错误(例如箭头方向颠倒或方程难以辨认)就足以使整张图失效,结构保真度本质上是合取性的:在一个维度上的正确性无法弥补另一维度的失败。当前的开源模型无法满足这一标准。有监督微调(SFT)虽然能学习合理的布局,但无法可靠地保证结构正确性;而基于标量奖赏的后训练则模糊了究竟是哪个结构维度出现了问题。为解决这一问题,我们提出 SciForma,一个用于科学方法示意图结构保真生成的框架。具体而言,SciForma 将示意图质量分解为三个结构轴:组件、箭头和文本,并由一个结构清单引导。在此基础之上,我们构建了用于结构化训练的 SciFormaData-700K 和用于逻辑验证评估的 SciFormaBench-2K。为弥补 SFT 留下的差距,我们开发了多维合取偏好优化(M-DPO),它强制所有轴同时正确,并在后训练中自适应地将梯度路由到最薄弱的维度。同样的结构清单还使得推理时能够通过迭代编辑来纠正残留错误。这种组合使得 SciForma-9B 在 SciFormaBench-2K 和 AIBench 上均超越了所有开源基线以及 GPT-Image-1.5,将开放科学示意图生成的水平提升到接近专有级别的结构保真度。我们的代码和数据将在 https://github.com/microsoft/SciForma 提供。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18091)查看 PDF (https://arxiv.org/pdf/2607.18091)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18091)

在你的 agent 中获取此论文:

hf papers read 2607.18091

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.18091 以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.18091 以从此页面链接。

引用此论文的 Space0

没有 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.18091 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

FaithformBench:数学思维链自动形式化的忠实度基准

arXiv cs.CL

介绍了FaithformBench,一个用于评估数学思维链自动形式化系统忠实度的基准,通过测量扰动步骤上的有效性与无效性保持来评估。应用于八个AF系统后,揭示了普遍的“谄媚”现象,即无效输入被静默纠正。