先见后码:面向空间感知的教育动画生成中的视觉先验学习

arXiv cs.AI 论文

摘要

本文介绍了 OmniManim,一个基于渲染反馈感知的框架,利用大语言模型从自然语言描述生成教育动画。它通过引入显式的视觉规划、渲染后诊断和局部修复来解决元素重叠、对齐错误等视觉缺陷,并在新构建的数据集上展示了改进的渲染质量。

arXiv:2605.15585v1 Announce Type: new 摘要:大语言模型可以生成用于教育动画的可执行代码,但生成的渲染结果经常出现视觉缺陷,包括元素重叠、对齐错误以及动画连续性中断。这些缺陷无法仅从代码中可靠检测,只有在执行后才能显现。我们将此问题形式化为渲染反馈感知的约束代码生成:给定自然语言规范,模型必须生成可执行代码,其渲染输出满足仅在渲染后才能评估的结构化质量标准。为解决此问题,我们提出了 OmniManim,这是一个围绕共享场景状态、显式视觉规划、结构化渲染后诊断和局部修复构建的渲染反馈感知教育动画生成框架。在 OmniManim 中,Vision Agent 是一个特定任务的视觉规划模块:它通过从粗到细的边界框去噪预测稀疏关键帧布局,并优化一个感知插值的优化目标,以减少下游动画插值引起的中间帧故障。我们进一步构建了 ManimLayout-1K 和 EduRequire-500 两个数据集,并提供了一个可重复的评估协议,涵盖可执行性、教学质量、视觉质量和效率。在 EduRequire-500 上,OmniManim 在测量的渲染质量上超过了单模型基线和现有的多智能体框架。系统的消融研究进一步验证了显式视觉规划,尤其是其粗略空间先验、边界框优化以及感知插值的优化,是这些改进的核心。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:33

# 先见再码:为空间感知的教育动画生成学习视觉先验  
来源:https://arxiv.org/html/2605.15585  

岳佳莉¹,柯赫¹\*,李俊恒¹,陈书桐²,夏景康¹,苏志越¹,张俊驰¹,叶芒¹  
¹武汉大学  
²中国科学院大学  

###### 摘要  

大语言模型能够生成可执行的教育动画代码,但生成的渲染结果常常出现视觉缺陷,包括元素重叠、错位以及动画连续性中断。这些缺陷无法仅从代码中可靠检测,只有在执行后才能显现。我们将此问题形式化为**渲染反馈感知的约束代码生成**:给定自然语言规范,模型必须生成可执行代码,其渲染输出满足只有在渲染后才能评估的结构化质量标准。为了解决这个问题,我们提出**OmniManim**,一个围绕共享场景状态、显式视觉规划、结构化后渲染诊断和局部修复构建的渲染反馈感知教育动画生成框架。在OmniManim中,**视觉智能体**是一个任务特定的视觉规划模块:它通过从粗到细的边界框去噪预测稀疏关键帧布局,并优化一个插值感知的目标函数,以减少下游动画插值引起的中间帧失败。我们进一步构建了两个数据集**ManimLayout-1K**和**EduRequire-500**,并提供了一套可复现的评估协议,涵盖可执行性、教学质量、视觉质量和效率。在EduRequire-500上,OmniManim在测量的渲染质量上优于单模型基线和现有的多智能体框架。系统的消融研究进一步验证了显式视觉规划,特别是其粗粒度空间先验、边界框细化以及插值感知优化,是这些提升的核心。  

## 1 引言  

对高质量教育动画的需求远超人工制作的能力。端到端视频模型如Sora(Ho 等人,2022;Singer 等人,2023;Blattmann 等人,2023;Kondratyuk 等人,2023;Bar-Tal 等人,2024)实现了令人印象深刻的视觉保真度,但作为黑盒生成器,它们对符号内容、逻辑结构和组合精度——这些在教育场景中至关重要的属性——控制有限。因此,近期研究转向**以代码为中心的生成**,其中大语言模型生成可执行的 Manim 脚本而非像素级视频(Chen 等人,2025;Wang 等人,2026;Ku 等人,2025),从而能够确定性渲染、精确控制和可编辑输出;基准如 ManimBench(Rammuni Silva 等人,2026)和 ManiBench(Oli,2026)进一步在此范式下形式化了执行级评估。  

![图1](https://arxiv.org/html/2605.15585/S1.F1)  
**图1:** LLM 生成的教育动画中常见的渲染时失败模式。尽管生成的代码可执行,渲染输出仍会出现视口溢出、元素重叠、前一帧残留内容以及比例不匹配。这些缺陷难以仅从代码中检测,并促使我们提出渲染反馈感知的公式化描述。  

然而,**可执行正确性并不等同于渲染质量**。如图1所示,LLM 生成的 Manim 代码经常产生具有重叠元素、遮挡、文本溢出、间距不均和视觉杂乱布局的动画——这些缺陷无法可靠地从源代码中识别,只有在渲染后才变得明显。根本困难在于,教育动画的代码生成既需要符号推理,也需要细粒度的空间布局规划;LLM 在前者上有效,但在后者上不可靠。多智能体设计并未解决这一差距,因为布局决策仍然委托给语言模型,而缺乏对渲染后 2D 场景的显式基础。渲染后批评和基于 VLM 的评估可以标记可见缺陷,但自然语言反馈难以转化为精确的坐标调整。  

我们通过 OmniManim(一个渲染反馈感知的教育动画生成框架)来解决这些局限性。关键洞察是,教育动画的失败不仅是代码级错误,还包括渲染时的空间和时间失败:两个单独有效的关键帧,一旦下游动画对帧进行插值,仍然可能产生重叠、遮挡或关系违反。因此,OmniManim 通过一个任务特定的**视觉智能体**将视觉规划与代码合成分离。视觉智能体不是将布局生成作为独立目标,而是为 Manim 代码生成提供显式的稀疏关键帧计划,使用从粗到细的边界框去噪和一个插值感知的目标函数作为实现工具。通过将布局规划作为中间表示暴露出来,LLM 专注于生成在结构上正确且在语义上忠实于输入规范的可执行代码。OmniManim 还结合了基于确定性计算机视觉分析的结构化渲染反馈循环,使得在显式视觉质量约束下进行迭代精炼成为可能。我们将此设置形式化为**渲染反馈感知的约束代码生成**,目标是生成可执行代码,其渲染输出满足只有在渲染后才能评估的结构化后渲染质量标准。  

我们的贡献如下:  
- •我们识别出空间布局失败是 LLM 基于动画代码生成的根本瓶颈,即使在多智能体架构下仍然存在,并将该任务形式化为**渲染反馈感知的约束代码生成**。  
- •我们提出 **OmniManim**,一个渲染反馈感知的系统框架,维护共享场景状态,分离语义解析、视觉布局规划、代码生成和局部修复,并使用结构化渲染诊断指导精炼。  
- •我们设计了**视觉智能体**作为 Manim 动画的任务特定视觉规划模块:它通过从粗到细的边界框去噪预测稀疏关键帧布局,并应用一个**插值感知**的目标函数来处理下游动画插值。  
- •我们构建了两个新数据集——**ManimLayout-1K**(训练)和 **EduRequire-500**(评估)——以及一套涵盖视觉、教学和效率指标的可复现评估协议,并描述了这些研究工件的预期发布政策。  
- •在 EduRequire-500 上的大量实验表明,OmniManim 在布局相关指标上优于单模型和多智能体基线,消融实验将视觉智能体及其插值感知目标函数确定为提升的关键驱动力。  

## 2 相关工作  

##### 以代码为中心的教育可视化。  
LLM 驱动的视觉内容代码生成跨越多个框架。在 Manim 生态系统中,Code2Video(Chen 等人,2025)提出了一个三智能体流水线,TheoremExplainAgent(Ku 等人,2025)针对定理解释,TeachMaster(Wang 等人,2026)编排多智能体协作以生成适合课程的视频;ManimBench(Rammuni Silva 等人,2026)和 ManiBench(Oli,2026)提供了评估基准。在 Manim 之外,DeTikZify(Belouadi 等人,2024)从草图中合成科学图形作为 TikZ 程序,DiagrammerGPT(Zala 等人,2024)使用 LLM 规划的布局生成跨平台的开放域图表,EduVisAgent(Ji 等人,2025)通过专门的智能体协作生成教育可视化。这些工作验证了在不同输出模态下的以代码为中心的范式,但主要评估执行成功或高级语义,未解决时间动画中的空间布局失败。这一差距促成了 OmniManim:一个在语义解析和代码合成之间显式插入视觉智能体布局规划的渲染反馈感知系统。  

##### 多智能体系统和迭代精炼。  
ChatDev(Qian 等人,2024)和 MetaGPT(Hong 等人,2024)将软件开发分解为专门的智能体角色,而 AutoGen(Wu 等人,2023)提供灵活的多智能体协调。对于迭代精炼,Self-Debugging(Chen 等人,2023)、Reflexion(Shinn 等人,2023)、Self-Refine(Madaan 等人,2023)和 ReAct(Yao 等人,2023)使用执行轨迹、自我反馈或工具交互来指导修正,MatplotAgent(Yang 等人,2024)采用基于 VLM 的视觉验证。Toolformer(Schick 等人,2023)进一步表明语言模型可以学习调用外部工具,而链式思维和自我一致性等提示策略提高了推理可靠性(Wei 等人,2022;Wang 等人,2023)。然而,现有框架并未纳入渲染感知的空间约束。OmniManim 通过共享场景状态、专门的视觉智能体和结构化渲染诊断扩展了多智能体协调,使得能够基于渲染出的伪影而非仅代码级属性进行优化。  

##### 布局生成。  
自动布局生成已通过对抗、变分、注意力和扩散模型进行研究。LayoutGAN(Li 等人,2019)和 LayoutVAE(Jyothi 等人,2019)从语义输入生成结构化的视觉布局,而 LayoutTransformer(Gupta 等人,2021)使用自注意力建模布局元素。扩散模型(Ho 等人,2020;Song 等人,2021b;Nichol 和 Dhariwal,2021;Song 等人,2021a)以及相关的基于流的公式化(Lipman 等人,2023;Liu 等人,2023b)为生成建模提供了通用的去噪框架。在布局生成中,LayoutDM(Inoue 等人,2023)将离散扩散应用于可控布局合成,LayoutDiffusion(Zheng 等人,2023a)使用布局条件扩散进行布局到图像的生成,图形布局扩散方法进一步改进了类似文档的布局合成(Zhang 等人,2023),基于 Transformer 的变体(Chai 等人,2023)探索了条件布局生成。LACE(Chen 等人,2024)将美学约束纳入基于扩散的布局生成。这些方法为排列静态单帧视觉元素提供了有用的工具,但它们并不直接生成可执行的动画代码,也不考虑对象生命周期、时间调度和后渲染插值失败。因此,我们在渲染反馈感知的代码生成框架中,使用基于去噪的布局建模作为内部视觉规划组件,而不是将静态布局生成定位为我们的目标任务。  

## 3 方法论  

### 3.1 问题形式化  

给定一个自然语言教学需求 \(r\),我们的目标是生成可执行的动画代码 \(c\),其渲染输出在教学上正确且在视觉上有效。直接将语言映射到代码是困难的,因为执行正确性并不能保证渲染质量。因此,我们引入一个中间结构化的场景状态 \(s\),并将生成过程分解为场景解析器和代码生成器:  

\[
h: \mathcal{R} \rightarrow \mathcal{S}, \qquad g: \mathcal{S} \rightarrow \mathcal{C}, \qquad f = g \circ h.
\]

这里,\(h\) 将输入需求转换为结构化的场景规格说明,而 \(g\) 在此规格说明条件下生成可执行代码。场景状态显式地表示下游生成所需的信息,包括场景对象、语义关系、教学角色、时间计划和布局变量。在此形式化下,该任务被处理为在共享结构化状态上的约束代码合成,而非无约束的文本到代码生成。  

### 3.2 智能体框架概述  

![图2](https://arxiv.org/html/2605.15585/S3.F2)  
**图2:** OmniManim 概览。系统在四个耦合的智能体之间维护一个共享场景状态:场景智能体、视觉智能体、代码智能体和修复智能体。视觉智能体预测关键帧布局,代码智能体将其转换为可执行的 Manim 代码,修复智能体使用渲染诊断来精炼结果。  

图2展示了整体框架。OmniManim 围绕一个**共享场景状态**组织,该状态作为智能体之间的通信接口。智能体不交换自然语言消息,而是从公共结构化表示中读取和写入,这使得生成过程明确、可编辑且可修复。在对象层面,每个场景元素由其身份、类型、内容、教学角色、布局、时间调度、生成的代码块和验证状态表示。初始场景状态包含对象集合、关系集合、教学注释和粗略的时间计划。基于此状态,系统进行四个阶段。首先,**场景智能体**将需求解析为规范化的场景模式,包含对象、关系、教学角色和时间线索。其次,**视觉智能体**在插值感知约束下预测从粗到细的边界框布局,用于稀疏关键帧。第三,**代码智能体**将优化后的布局和时间计划映射为可执行的 Manim 代码。第四,**修复智能体**渲染程序,计算关于重叠、关系违反、边界溢出和编译失败的结构化诊断,并将反馈路由到局部修正,而不是重新生成整个脚本。这种共享状态协作使得在显式视觉约束下进行结构化精炼成为可能。智能体层面的更多细节在补充材料中提供。  

### 3.3 视觉智能体  

视觉智能体是 OmniManim 中一个任务特定的视觉规划模块。其角色不是充当通用布局生成器,而是

相似文章

几何至关重要:用于学习语义对应的3D基础先验

Hugging Face Daily Papers

本文介绍了一个后训练框架,利用SAM3D的3D先验来改进2D基础特征中的语义对应,解决了左右混淆和重复部分等问题。该方法使用实例特定的3D重建,无需姿态注释或球面几何捷径。

MAOAM:基于视觉-语言模型的统一物体与材质选择

Hugging Face Daily Papers

本文提出MAOAM,一个统一的视觉-语言模型框架,能够通过文本或点击交互实现精确的物体和材质选择,用于交互式图像编辑。它引入了一个可扩展的数据生成流程,并展示了在推理时结合文本和点击的涌现提升。