SAGE:基于属性引导规则演化的自演化分镜技能
摘要
SAGE是一个利用自演化规则和属性引导更新来自动化短剧制作中分镜生成的框架,实现了专家级性能,并在商业部署中减少了制作时间。
arXiv:2608.17468v1 公告类型:新
摘要:分镜图将剧本转化为视觉镜头计划,用于自动化短剧制作。专业分镜制作依赖于隐性导演专业知识,仍然是行业瓶颈。大型语言模型可以自动化这一步骤,但提供导演知识的方法面临三个挑战:(1)知识获取:技艺仍然隐含在范例中,或必须手动编写。(2)知识精炼:编写的知识未针对执行结果进行评估,且不透明的生成阻止了反馈归因于每个决策背后的知识。(3)知识注入:注入所有知识超出了可用上下文,而为每个叙事组手动选择则无法扩展。我们提出了SAGE(基于属性引导演化的技能),一个部署的框架,从专家示范中学习、归因、演化和路由导演知识。SAGE通过对比每个训练剧本与其专家分镜图,得出独立于剧集内容的规则。在生成过程中,模型记录每个叙事组采用的规则。将这些记录与局部反馈结合,实现对单个规则的定向更新。演化的规则形成带有路由索引的场景包,因此每个组仅检索适合其情况的有限集合,无需专家干预。在三种类型的18个测试剧集上,SAGE在专家验证的评分标准上获得77.8分,而专业导演为77.1分。在Virtual Film Studio上部署14天,SAGE产生了1,344个叙事组输出;87.2%在无需实质性编辑的情况下被接受,制作团队记录了每集制作时间减少超过83%。我们发布了PROSE,这是第一个将剧本与专业导演的分镜图配对的公开数据集,涵盖68个剧集:https://github.com/creDreams/PROSE。
查看缓存全文
缓存时间: 2026/08/19 10:04
# 通过归因引导的规则演化实现分镜技能自进化 来源:https://arxiv.org/html/2608.17468 ## SAGE:通过归因引导的规则演化实现分镜技能自进化 CCS:计算方法 人工智能 Maolin Ran, Xiaoyang Lu 隶属机构:上海交通大学,上海,中国 邮箱:[[email protected]](mailto:[email protected]),Jiaqi Liu 隶属机构:上海交通大学,上海,中国 邮箱:[[email protected]](mailto:[email protected]),Jian Wang 隶属机构:CreativeFitting,上海,中国 邮箱:[[email protected]](mailto:[email protected]),Weiwen Liu 隶属机构:上海交通大学,上海,中国 邮箱:[[email protected]](mailto:[email protected]),Jianghao Lin 隶属机构:上海交通大学,上海,中国 邮箱:[[email protected]](mailto:[email protected]),Yong Yu 隶属机构:上海交通大学,上海,中国 邮箱:[[email protected]](mailto:[email protected])以及Weinan Zhang 注:通讯作者。 隶属机构:上海交通大学,上海,中国 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 分镜将剧本分解为逐镜头的视觉方案,驱动自动化短剧制作。由于高质量分镜依赖于专业导演的隐性知识,其在工业化规模应用中仍是能力瓶颈。大型语言模型可以自动化这一过程,但现有赋予模型导演知识的方法面临三大挑战:(1)知识获取:技艺要么隐含在范例中,要么需手工编写,因此显式知识仅存在于人工编写之处。(2)知识精炼:已编写的知识从未根据执行结果进行评估,且不透明的生成过程导致反馈无法归因于支撑每个决策的知识。(3)知识注入:注入全部知识会超出可用上下文长度,而为每个叙事组手工挑选知识则无法扩展。针对这些挑战,我们提出了SAGE(基于归因引导演化的技能)。SAGE是一个已部署的框架,它从专家演示中学习、归因并演化导演知识。它首先通过对比每部训练剧本及其专家分镜,提取无内容规则。在生成时,模型会声明每个叙事组采用了哪些规则。将这些记录与局部反馈结合,可在单条规则层面实现归因,从而驱动针对性的规则更新。演化后的规则随后通过语义聚类被整合为情景包,并通过路由索引进行访问。因此,每个叙事组仅检索与其情境匹配的有限情景包,无需专家干预。在涵盖三个类型的18个测试集剧集上,SAGE在专家验证的评分标准上获得77.8分,超过了专业导演的77.1分。在商业短剧制作平台Virtual Film Studio部署14天期间,它生成了1,344个叙事组输出。其中,87.2%无需实质性修改即被接受,制作团队记录每集编写时间减少了超过83%。我们发布了PROSE,这是首个将剧本与专业导演编写的分镜配对的公开数据集,涵盖68集,地址为https://github.com/creDreams/PROSE。 ###### 关键词 自进化智能体、技能学习、信用分配、分镜生成 ## 1. 引言 五行对比展示了四个系统在一个剧本节拍上的表现。第一行是输入的剧本台词。接下来的四行分别对应SAGE、Few-shot、CoT和Vanilla。每一行包含一个文本分镜记录、三个镜头语言字段(景别、机位角度和运镜方式)、一个灰度缩略图和一个威胁程度指示器。SAGE行显示了特写、低角度和推进。其他三行显示平角度和固定机位。最后一行总结了对比结果。 图1。在*His Toyboy* EP001(一个保留测试集剧集)的一个剧本节拍上,基于相同剧本、骨干LLM和分镜模式下各系统的镜头语言决策。只有SAGE选择了能强化Victor主导地位的低角度推进,而Few-shot和CoT保持角度平坦,Vanilla则拉远构图,削弱了权力动态。只有文本记录是系统输出;缩略图和威胁标签是事后解读,未纳入评估。 随着视频生成模型的成熟,自动化电影制作系统越来越多地将剧本转化为视频。在这些系统中,*分镜*是连接创作意图与视频合成的中间产物。它逐镜头地指定视觉内容、景别、机位角度和运镜方式。其质量直接制约下游视频的保真度、连贯性和电影表现力。手动分镜限制了短剧行业的产能。在抖音和TikTok等平台上,每年有数万集连续剧上线,但从概念到发布的周期通常只有几周甚至几天,这迫使创作者同时身兼多职以满足行业的效率要求。分镜仍然由手工编写,这一人工环节限制了短剧的制作速度。这一瓶颈持续存在,是因为分镜依赖于隐性的导演专业知识。导演需要共同决定镜头节奏、视觉描述、景别、机位角度和运镜方式,但这些决策背后的技艺很少被明确阐述为显式原则。在本研究涉及的商业平台上,导演制作一集需要超过一小时。 大型语言模型可以实现这一流程的自动化。然而,基准测试显示,前沿模型在镜头语言方面缺乏专业能力。图1通过一个戏剧节拍的例子说明了这一缺陷,其中直接生成默认使用平角度,未能传达场景的权力动态。因此,有效的自动化需要将领域知识赋予LLM。 先前的努力通过三种机制将此类知识注入LLM。Few-shot提示提供剧本和分镜范例,思维链(CoT)提示则添加了专家编写的推理链。技能则将稳定的工作流与独立的知识文件打包在一起,这一设计已成为工业实践。这些机制使LLM能够利用导演知识,但仍面临三大挑战: **C1:知识获取。** 在现有机制中,知识要么隐含在范例中,要么需手工编写。Few-shot范例隐式编码了技艺,模型必须在推理时重新归纳,且永远无法获得可检查、可复用的形式。CoT链和技能文件显式地陈述了知识,但导演必须亲自编写每一条链和每一个文件。因此,显式知识仅存在于人工编写之处,挑战在于如何从专家演示中自动提取知识。 **C2:知识精炼。** 一旦编写,知识便保持固定,从未根据执行结果进行评估,因此其缺陷始终未被发现。因此,精炼必须使用执行反馈。然而,仅有反馈是不够的,因为生成过程是不透明的:它不揭示注入的哪部分知识塑造了哪个决策。现有管道在提取时或通过整个轨迹的投票来评判知识,而未追踪其在生成中的使用,且据报道,在没有这种定位的情况下进行自我纠正会降低性能。因此,有效的精炼要求生成过程可追踪,以便反馈能够归因于对每个决策负责的知识。 **C3:知识注入。** 在推理时,赋予模型的知识必须自动选择。当前做法通过手工选择来确保相关性,先前的自动检索仍然在手工定义的知识单元上进行。当每个叙事组都需要从数千条条目中做出自己的选择时,手工选择无法扩展,而注入全部知识又会超出可用上下文。 我们提出了SAGE(基于归因引导演化的技能),这是一个在技能基座上解决这三大挑战的框架,该基座已将稳定的工作流与显式知识库分离。对于获取,SAGE通过对比每部训练剧本及其专家分镜,自动提取无内容规则(C1)。对于精炼,生成时会声明每个叙事组采用了哪些规则。将这些*规则采用记录*与局部反馈相结合,产生三种演化操作:修正误触发的规则,为覆盖缺口添加新规则,以及退役未使用的规则(C2)。对于注入,演化后的规则通过语义聚类整合为带路由索引的*情景包*,因此每个叙事组仅检索与其情境匹配的包(C3)。在涵盖三个剧种的18集测试集上,SAGE得分77.8,超过了专业导演的77.1分。所有分数均来自一个LLM评分标准,其与三位专业导演的一致性超过了人类间的一致性(§4.6)。它还优于使用导演编写的推理链和相邻剧集范例的强大基线。归因引导的迭代相比规则热启动贡献了3.6分,而无归因的迭代在达到峰值后便低于起始点。整合后的规则被不变地转移到另外三个骨干LLM上,获得了8.1%到21.2%的相对增益。 我们的贡献在于: - **框架**。SAGE将LLM技能的知识库视为可学习参数,并从专家演示中演化它。据我们所知,SAGE是首个在单条规则粒度上通过信用分配演化此类知识库的框架,而非对整个技能文档使用单一验证分数。该框架涵盖演化、整合和部署,并在商业生产环境中运行。 - **机制**。一种规则层面的归因机制,对以自然语言表达的知识进行信用分配。它将编写与执行反馈联系起来,这是静态技能所缺乏的。我们的消融和迭代研究表明,没有归因的迭代会较早达到峰值然后下降。 - **数据集**。我们发布了PROSE,据我们所知,这是首个将剧本与*由专业人类导演编写*的分镜配对的公开数据集。它涵盖三个不同剧种的专业制作系列中的68集。而先前的资源提供的则是模型从成品视频中逆向工程的镜头注释。 - **部署**。我们在商业短剧制作平台Virtual Film Studio中部署了SAGE,并报告了一项针对三部未见过的在播剧的为期14天的研究。在1,344个叙事组输出中,87.2%无需实质性修改便进入生产。每集的编写时间从超过一小时降至约10分钟,减少了超过83%。因此,分镜从手工编写转变为审核,这正是消除产能瓶颈的关键。 ## 2. 相关工作 **基于LLM的分镜生成**。FilmAgent和MovieAgent协调角色扮演智能体。FilMaster则从44万段电影片段中检索镜头语言规范。两者均未从专业分镜演示中学习显式、可检查的知识库。DramaDirector是与我们任务最接近的系统,因为它使用SFT和GRPO对LLM规划器进行微调以生成短剧分镜,但它将电影知识隐式地保存在模型权重中。另一条研究线生成*图像*分镜,关注的是视觉一致性而非我们研究的导演分解,而早期基于引擎的预可视化则在*手工指定*的规则下渲染镜头候选。基准研究一致发现前沿模型在镜头语言方面缺乏专业能力,这推动了显式知识注入。 **分镜数据集**。SkyScript-100M和DramaBoard将短剧剧本与镜头级注释配对。然而,它们的分镜是*从成品视频中逆向工程*得到的,因此捕捉的是最终呈现在屏幕上的内容,而非导演所做的决策。而PROSE发布的是导演原始的后期制作分镜,即演示监督演化所需的决策痕迹。 **自进化智能体中的经验知识**。自进化智能体从自身经验中改进;我们关注的是演化上下文而非权重的分支。Self-Refine和Reflexion在单个输出上迭代或存储轨迹级反思,而不积累超出任务范围的持久知识。未经辅助的自我纠正也被证明是不可靠的。第二个分支将经验提炼为持久的自然语言知识,表达为基于失败的规则、状态条件的指南、因果抽象,或精炼的洞见和程序性记忆。第三个分支将能力存储为可执行技能。Voyager...
相似文章
SAGE:基于状态、弃权感知的任务导向对话智能体评估
SAGE是一种新颖的任务导向对话智能体评估框架,它将评估基于对话状态变化,并使用弃权机制来提供成本效益高、准确的回合级判断,无需昂贵的LLM调用。
DrugSAGE:自演化智能体经验实现高效最先进的药物发现
DrugSAGE是一个框架,能够积累并复用跨任务记忆,高效构建最先进的药物发现模型,在保留任务上比基线智能体性能提升10-30%。
SAGE:基于智能体引导的随机提示优化
介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。
Socratic-SWE:基于轨迹派生的智能体技能实现自进化编码智能体
Socratic-SWE 提出了一种用于软件工程智能体的闭环自进化框架,该框架利用历史求解轨迹生成针对性修复任务,经过三次迭代后在 SWE-bench Verified 上达到 50.40%。
SAGE: 用于SQL中AI函数的统一代数与自适应执行框架
SAGE 引入了一个统一的逻辑和物理框架,用于SQL中的AI函数,使用三个原语(AI_SCALAR、AI_AGG、AI_JOIN)来优化执行,显著减少模型调用和成本。