WanPE:面向现代文本到视频生成的电影级提示增强

Hugging Face Daily Papers 论文

摘要

WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。

视频生成始于在文本空间中创作电影剧本,然后转化为像素。随着当代视频生成器扩展到30秒并忠实遵循复杂条件,文本提示在很大程度上指导了制作过程,规划动作、摄像机轨迹、灯光和声音如何在多个镜头序列中展开。在本文中,我们介绍了WanPE,一个拥有3970亿参数的提示增强模型,在105万个真实视频上训练,以掌握导演级别的电影规划。WanPE通过基于视频的反向构建来制定镜头级别的电影计划,并采用语义一致性GRPO(SC-GRPO)来忠实保持用户需求在镜头之间和随时间变化。为了基准测试此能力,我们策划了WanPEval,一个由人工标注的测试平台,涵盖5到30秒的持续时间,跨越不同的意图粒度,支持约11K的盲对评估。当驱动Wan3.0的视频生成器时,WanPE-397B在5-15秒内将人类对原始用户提示的偏好提高了10.66-18.84点,在30秒场景中大幅提高了50.86点。消融研究表明,反向构建明显优于正向重写,而SC-GRPO在不同模型规模下稳健地保持语义保真度。最终,WanPE在5-15秒内领先所有评估的商业产品,并在30秒内与Seedance 2.5保持竞争力。
查看原文
查看缓存全文

缓存时间: 2026/09/25 03:45

论文页面 - WanPE:面向现代文本到视频生成的电影级提示增强技术

来源:https://huggingface.co/papers/2609.30221 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

视频生成始于在文本空间中创作电影剧本,随后转化为像素数据。随着现代视频生成模型扩展至30秒时长并能忠实遵循复杂条件,文本提示在很大程度上主导着制作流程,规划动作、摄像机轨迹、灯光与声音在多镜头序列中的呈现方式。本文提出WanPE——一个拥有3970亿参数的提示增强模型,基于105万段真实视频训练,掌握导演级别的电影规划能力。WanPE通过视频驱动的反向构建技术制定镜头级电影计划,并采用语义一致性分组相对策略优化(SC-GRPO)确保跨镜头及时间轴上对用户需求的忠实传达。为评估该能力,我们构建了WanPEval基准测试集,涵盖5至30秒时长与不同意图粒度的人工标注测试场景,辅以约1.1万对盲评配对测试。当应用于Wan 3.0视频生成器时,WanPE-397B模型在5-15秒片段中比原始用户提示提升10.66-18.84个人类偏好分值,在30秒场景中更实现高达50.86分的显著提升。消融研究证实反向构建技术显著优于传统前向改写,而SC-GRPO能跨模型规模稳健保持语义保真度。最终,WanPE在5-15秒评测中超越所有参评商业方案,并在30秒领域保持与Seedance 2.5相当的竞争力。

查看arXiv页面(https://arxiv.org/abs/2609.30221)查看PDF(https://arxiv.org/pdf/2609.30221)项目页面(https://wan-pe.github.io/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.30221)

通过智能体获取本文:

hf papers read 2609.30221

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型关联本文

在模型README.md中引用arxiv.org/abs/2609.30221即可从本页面建立关联。

引用本文的数据集0

暂无数据集关联本文

在数据集README.md中引用arxiv.org/abs/2609.30221即可从本页面建立关联。

引用本文的Space 0

暂无Space关联本文

在Space README.md中引用arxiv.org/abs/2609.30221即可从本页面建立关联。

包含本文的收藏集0

暂无收藏集收录本文

将本文添加至收藏集(https://huggingface.co/new-collection)即可从本页面建立关联。

相似文章

视频模型的视觉提示工程

Hugging Face Daily Papers

本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。

从单体到模块化:段级自动提示词优化

arXiv cs.AI

本文介绍了SAPO,一种分段级自动提示优化方法,它将提示分解为角色、上下文、任务和输出格式,然后基于弱示例和强示例进行针对性改进。在多个基准测试上的评估表明,SAPO在GPT-3.5-Turbo和GPT-4o-mini上优于包括APE、OPRO、EvoPrompt、GEPA和StraGO在内的强APO基线。

BayesPrompt: 人类可读且合理的提示

arXiv cs.CL

本文介绍了BayesPrompt,一种贝叶斯方法,用于优化大型语言模型的提示,确保它们既高效又人类可读,而不像传统方法产生难以理解的伪提示。