Code2Video: 一个以代码为中心的教育视频生成范式

Papers with Code Trending 论文

摘要

Code2Video是一个以代码为中心的代理框架,用于生成教育视频,相比直接代码生成,提高了连贯性和可解释性。它包括一个多代理系统和一个新的评估基准。

尽管最近的生成模型在像素空间视频合成方面取得了进展,但它们在制作专业教育视频方面仍然有限,这些视频需要学科知识、精确的视觉结构和连贯的过渡,限制了它们在教育场景中的应用。直观地说,这些要求通过操作可渲染环境来更好地解决,可以通过逻辑命令(例如代码)明确控制。在这项工作中,我们提出了Code2Video,一个以代码为中心的代理框架,通过可执行的Python代码生成教育视频。该框架包含三个协作代理:(i) 规划器,将讲座内容组织成时间上连贯的流程并准备相应的视觉资产;(ii) 编码器,将结构化指令转换为可执行的Python代码,同时结合范围引导的自动修复以提高效率;(iii) 评论器,利用视觉语言模型(VLM)和视觉锚点提示来优化空间布局并确保清晰度。为了支持系统评估,我们构建了MMMC,一个专业制作的、学科特定的教育视频基准。我们评估MMMC的多个维度,包括VLM-as-a-Judge的美学分数、代码效率,特别是TeachQuiz,一个新颖的端到端指标,量化了VLM在遗忘后通过观看生成视频恢复知识的效果。我们的结果展示了Code2Video作为一种可扩展、可解释和可控的方法的潜力,实现了比直接代码生成提高40%的改进,并生成了与人工制作教程相当的视频。代码和数据集可在https://github.com/showlab/Code2Video获取。
查看原文
查看缓存全文

缓存时间: 2026/08/17 03:38

论文页面 - Code2Video:以代码为中心的教育视频生成范式

来源:https://huggingface.co/papers/2510.01174 发布于2025年10月1日

·

由https://huggingface.co/taesiri提交

taesiri (https://huggingface.co/taesiri) 于2025年10月2日

摘要

Code2Video 采用以代码为中心的智能体框架生成教育视频,相较于直接生成代码,提升了视频的连贯性与可解释性。

虽然近期的生成模型 (https://huggingface.co/papers?q=generative%20models) 在像素空间视频合成 (https://huggingface.co/papers?q=pixel-space%20video%20synthesis) 方面取得了进展,但在制作专业教育视频方面仍存在局限。此类视频需要学科知识、精确的视觉结构和连贯的转场,这限制了其在教育场景中的应用。直观地看,这些需求更适合通过操控可渲染环境来满足,而环境可以通过逻辑命令 (https://huggingface.co/papers?q=logical%20commands)(例如代码)进行显式控制。在本研究中,我们提出了 Code2Video,这是一个以代码为中心的智能体框架 (https://huggingface.co/papers?q=code-centric%20agent%20framework),旨在通过可执行的 Python 代码生成教育视频。该框架包含三个协作的智能体:(i) 规划器 (https://huggingface.co/papers?q=Planner),负责将课程内容结构化为时间连贯的流程并准备相应的视觉资产;(ii) 编码器 (https://huggingface.co/papers?q=Coder),负责将结构化的指令转换为可执行的 Python 代码,同时引入作用域引导的自动修复以提升效率;(iii) 评判器 (https://huggingface.co/papers?q=Critic),利用视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models)(VLM (https://huggingface.co/papers?q=VLM))并结合视觉锚点提示来优化空间布局并确保清晰度。为支持系统性评估,我们构建了 MMMC (https://huggingface.co/papers?q=MMMC),一个包含专业制作、特定学科教育视频的基准数据集。我们从多个维度对 MMMC (https://huggingface.co/papers?q=MMMC) 进行了评估,包括视觉语言模型评判的美学评分、代码效率,特别是 TeachQuiz (https://huggingface.co/papers?q=TeachQuiz)——这是一种新颖的端到端指标,用于量化一个视觉语言模型在经过遗忘处理后,通过观看生成的视频能多大程度上恢复知识。我们的结果表明,Code2Video 作为一种可扩展、可解释且可控的方法具有潜力,相比直接生成代码实现了 40% 的改进,并能制作出与人工制作的教程 (https://huggingface.co/papers?q=human-crafted%20tutorials) 相媲美的视频。代码和数据集可在 https://github.com/showlab/Code2Video 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2510.01174) 查看 PDF (https://arxiv.org/pdf/2510.01174) 项目页面 (https://showlab.github.io/Code2Video/) GitHub 1.97k (https://github.com/showlab/Code2Video) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2510.01174)

在你的智能体中获取本文:

hf papers read 2510.01174

没有最新版 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2510.01174 以从本页面链接。

引用本文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2510.01174 以从本页面链接。

引用本文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2510.01174 以从本页面链接。

包含本文的收藏夹 7

浏览包含此论文的 7 个收藏夹 (https://huggingface.co/collections?paper=2510.01174)

相似文章

编码代理作为世界模拟器表现良好

arXiv cs.AI

本文提出了一种基于代理的框架,利用编码代理从自然语言提示生成物理上可信的世界模拟,在物理准确性和指令保真度方面优于基于视频的模型。

CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。