Code2Video: 一个以代码为中心的教育视频生成范式
摘要
Code2Video是一个以代码为中心的代理框架,用于生成教育视频,相比直接代码生成,提高了连贯性和可解释性。它包括一个多代理系统和一个新的评估基准。
查看缓存全文
缓存时间: 2026/08/17 03:38
论文页面 - Code2Video:以代码为中心的教育视频生成范式
来源:https://huggingface.co/papers/2510.01174 发布于2025年10月1日
·
由https://huggingface.co/taesiri提交
taesiri (https://huggingface.co/taesiri) 于2025年10月2日
摘要
Code2Video 采用以代码为中心的智能体框架生成教育视频,相较于直接生成代码,提升了视频的连贯性与可解释性。
虽然近期的生成模型 (https://huggingface.co/papers?q=generative%20models) 在像素空间视频合成 (https://huggingface.co/papers?q=pixel-space%20video%20synthesis) 方面取得了进展,但在制作专业教育视频方面仍存在局限。此类视频需要学科知识、精确的视觉结构和连贯的转场,这限制了其在教育场景中的应用。直观地看,这些需求更适合通过操控可渲染环境来满足,而环境可以通过逻辑命令 (https://huggingface.co/papers?q=logical%20commands)(例如代码)进行显式控制。在本研究中,我们提出了 Code2Video,这是一个以代码为中心的智能体框架 (https://huggingface.co/papers?q=code-centric%20agent%20framework),旨在通过可执行的 Python 代码生成教育视频。该框架包含三个协作的智能体:(i) 规划器 (https://huggingface.co/papers?q=Planner),负责将课程内容结构化为时间连贯的流程并准备相应的视觉资产;(ii) 编码器 (https://huggingface.co/papers?q=Coder),负责将结构化的指令转换为可执行的 Python 代码,同时引入作用域引导的自动修复以提升效率;(iii) 评判器 (https://huggingface.co/papers?q=Critic),利用视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models)(VLM (https://huggingface.co/papers?q=VLM))并结合视觉锚点提示来优化空间布局并确保清晰度。为支持系统性评估,我们构建了 MMMC (https://huggingface.co/papers?q=MMMC),一个包含专业制作、特定学科教育视频的基准数据集。我们从多个维度对 MMMC (https://huggingface.co/papers?q=MMMC) 进行了评估,包括视觉语言模型评判的美学评分、代码效率,特别是 TeachQuiz (https://huggingface.co/papers?q=TeachQuiz)——这是一种新颖的端到端指标,用于量化一个视觉语言模型在经过遗忘处理后,通过观看生成的视频能多大程度上恢复知识。我们的结果表明,Code2Video 作为一种可扩展、可解释且可控的方法具有潜力,相比直接生成代码实现了 40% 的改进,并能制作出与人工制作的教程 (https://huggingface.co/papers?q=human-crafted%20tutorials) 相媲美的视频。代码和数据集可在 https://github.com/showlab/Code2Video 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2510.01174) 查看 PDF (https://arxiv.org/pdf/2510.01174) 项目页面 (https://showlab.github.io/Code2Video/) GitHub 1.97k (https://github.com/showlab/Code2Video) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2510.01174)
在你的智能体中获取本文:
hf papers read 2510.01174
没有最新版 CLI?运行 curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2510.01174 以从本页面链接。
引用本文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2510.01174 以从本页面链接。
引用本文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2510.01174 以从本页面链接。
包含本文的收藏夹 7
浏览包含此论文的 7 个收藏夹 (https://huggingface.co/collections?paper=2510.01174)
相似文章
VideoCoCo:通过代理双引擎系统实现物理一致视频生成的代码即思维链框架
介绍了VideoCoCo,一种代理双引擎框架,使用可执行的Blender代码作为思维链中间表示,用于物理一致的视频生成,在PhyGenBench和VBench-2.0上取得了最先进的分数。
编码代理作为世界模拟器表现良好
本文提出了一种基于代理的框架,利用编码代理从自然语言提示生成物理上可信的世界模拟,在物理准确性和指令保真度方面优于基于视频的模型。
CogOmniControl: 基于推理的可控视频生成,通过创意意图认知
CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。
PairCoder++:结对编程作为已验证代码驱动的多模态与结构化工件生成的通用范式
PairCoder++ 提出了一种结对编程范式,其中 Driver 代理编写代码,Navigator 代理利用工具链验证进行审查。在 17 个基准测试中,该方法在生成图表、科学图像、CAD 模型、3D 场景及其他结构化工件方面取得了显著改进。
AVA-Encoder:迈向智能体原生的视频表征学习
AVA-Encoder 通过基于知识图谱的智能体自编码学习结构化视频表征,能够实现电影级视频生成与推理,同时减少 Token 使用量。