拒绝的艺术如何提升视频质量:为基于教学法的AI内容创作设计双层把关系统

arXiv cs.AI 论文

摘要

本文提出了一种针对AI生成教育视频的双层把关系统,结合教育工作者的输入和自动化指标来提升教学法质量,展示了基于原则的对AI输出的抵抗如何改进教学设计。

arXiv:2608.19812v1 Announce Type: new 摘要:为防止采用美学上精良但教学法上有缺陷的AI内容,我们研究了一个具有两层结构化拒绝的视频创作流程。第一层赋能教育工作者基于多媒体学习理论迭代重塑AI脚本,第二层则采用自动化指标来标记教学连贯性和叙事-视觉同步性方面的违规行为。尽管每一层都不是全面的,但它们的协同作用确保了基于原则的抵抗——即推迟AI输出直到其满足严格标准的行为——成为提升质量的催化剂。评估结合了对3个主题的23位教育工作者的研究以及来自既定科学和哲学课程的7个主题的自动化指标,显示两层都独立地改进了相同教学维度,表明深思熟虑的抵抗与生成式AI并非对立而是合作伙伴。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:05

# 当“拒绝”能产出更好的视频:为基于教学理论的AI内容创作设计双重审查机制  
来源:https://arxiv.org/html/2608.19812  
## 当“拒绝”能产出更好的视频:为基于教学理论的AI内容创作设计双重审查机制  
会议:理解与应对教育领域对AI的关键性抵触;2026年4月13–17日;西班牙巴塞罗那  
CCS:以人为中心的计算 用户研究  
CCS:应用计算 交互式学习环境  

Yearim Kim  
注:两位作者对本研究贡献均等。  
邮箱:[[email protected]](mailto:[email protected])  
隶属机构:首尔大学,首尔,大韩民国  

Injun Baek  
邮箱:[[email protected]](mailto:[email protected])  
隶属机构:首尔大学,三星电子,大韩民国  

Nojun Kwak  
注:通讯作者  
隶属机构:首尔大学,首尔,大韩民国  
邮箱:[[email protected]](mailto:[email protected])  

2026 © , 2026;  

###### 摘要  

为防止采用表面精美但教学设计有缺陷的AI内容,我们研究了一种包含两层结构化“拒绝”机制的视频创作流程。第一层支持教育者根据多媒体学习理论迭代重构AI脚本;第二层则通过自动化指标检测教学连贯性与叙事-视觉同步性方面的违规问题。尽管单独来看任何一层均非完备,但两者的协同作用确保了“原则性拒绝”——即推迟AI输出直至其满足严格标准这一行为——能成为提升质量的催化剂。通过一项针对23位教育者、涵盖3个主题的研究,以及基于经典科学与哲学课程、涵盖7个主题的自动化指标评估,结果表明:两个层次均能独立提升相同的教学维度,这说明深思熟虑的抵触与生成式AI并非对立,而是伙伴。  

###### 关键词:  

人机协作,教育AI,生成式AI,多媒体学习  

## 1. 引言  

尽管现代AI模型(2 (https://arxiv.org/html/2608.19812#bib.bib1);1 (https://arxiv.org/html/2608.19812#bib.bib3))能在一分钟内合成看起来专业的教育视频,但表面的精致并不能保证教学的严谨性。当前的视频生成流程往往注重视觉吸引力而非教学要素,例如解说的精确时间对齐或前提概念的战略性排序。因此,输出结果常以“看起来好”而非“教得好”为优化目标。这一差距之所以重要,是因为教育者正日益被期望以最小干预程度采用AI生成的材料。追求无缝、无摩擦的采用压力会将任何迟缓视为低效——这种立场可能将教育者的角色从专业决策者简化为被动消费者。然而,我们认为,教学摩擦并非需要消除的障碍,而是体现专业责任的场域。刻意的犹豫时刻——无论是教育者质疑脚本的逻辑流程,还是算法标记叙事截断——恰恰是教学质量得以锻造之处。  

表1. Mayer的12条CTML原则(3 (https://arxiv.org/html/2608.19812#bib.bib2)),用于减少外在负荷、管理内在负荷并促进生成加工。  
一致性、信号提示、冗余、空间邻近、时间邻近、分段、预训练、模态、多媒体、个性化、语音、图像  

我们将此方法概念化为“原则性抵制”:基于理论、有目的地对未达教学标准的AI输出进行驳回。该方法根植于Mayer的多媒体学习认知理论(CTML)(3 (https://arxiv.org/html/2608.19812#bib.bib2))——一个包含12条经过实证验证的有效多媒体教学原则的框架(表1 (https://arxiv.org/html/2608.19812#S1.T1))——我们开发了PedaCo(教学共创),一个实现此抵制机制的人机协作系统。PedaCo整合了两个互补的审查机制:通过CTML标准审查脚本,以及通过可计算测量的CTML维度评估成品视频的自动化指标。本文阐述了这一双重方法背后的设计原理,总结了来自人类与计算评估的趋同证据,并提出了关于教育AI系统应如何平衡人类自主权与自动化保障的开放性问题。  

## 2. 两层抵触机制  

在我们的框架中,“原则性抵制”具体体现为三种形式:拒绝(要求重新生成)、修订(手动编辑)和否决(驳回自动标记)。这些并非临时反应,而是基于CTML原则、由规范驱动的决策。该框架基于一个简单观察:教育者和算法擅长发现不同类型的问题——人类教育者善于识别细微的教学失配(如内容对目标受众过于深奥),而算法则能提供精确、高分辨率的结构完整性验证(如识别解说与视觉之间的时间错位)。在同一流程中设置这两个检查点,创造了两者单独无法实现的重叠覆盖。  

### 2.1. 第一层:脚本阶段的人工教育者审查  

第一层在任何视频渲染之前介入(图1 (https://arxiv.org/html/2608.19812#S2.F1) 左侧)。教育者首先输入学习内容,并配置系统应强制执行哪些CTML原则。随后,LLM(4 (https://arxiv.org/html/2608.19812#bib.bib4))生成初始脚本,并通过结构化审查循环。AI审查员——本身由CTML原则提示——生成按原则组织的反馈,识别潜在违规而非确定性判断(例如,“场景3在未事先解释的情况下引入术语,可能违反了‘预训练’原则”)。人类教育者随后决定接受哪些内容、手动修订哪些内容,以及要求重新生成哪些内容。此审查循环可重复进行,直至教育者对脚本满意。  

在脚本层面进行审查的设计选择是刻意的。文本修订在计算和劳动效率上都很高,而融入渲染视觉叙事中的教学错误在合成后几乎无法修正。通过将人类检查点设置在此中间阶段,我们使教学批判在经济上可行。这确保系统保持咨询性,保留教育者基于其特定课程背景和教学风格对AI建议说“不”的专业权威。  

### 2.2. 第二层:视频合成后的自动化指标评估  

第二层通过复合指标(图1 (https://arxiv.org/html/2608.19812#S2.F1) 右侧)对最终视频进行合成后评估。我们自动评估五个维度:一致性、冗余、时间邻近、模态和图像质量。教育者审查原则级别的分数,并决定是接受视频还是返回脚本阶段进行针对性修订。人类抵触与自动化抵触之间的这一边界是战略性的设计决策。虽然时间同步等维度适合可靠的计算测量,但其他维度——如个性化(语气)——需要对课程结构和学习者心理的深入理解,目前这仍是人类专家的专属领域。通过仅在算法可行性与教学必要性一致的地方实现自动化,我们创建了一个强大的安全网,防止技术倒退,同时不边缘化人类判断。  

图1. 双重审查界面。左侧面板(第一层:脚本级别)从学习内容(aa)和生成原则(bb)生成初始脚本(dd),然后通过基于审查约束(cc)的AI批评和修订草稿(ee)来支持教育者的修订。右侧面板(第二层:视频级别)通过自动化指标(h,i)可视化不可见的教学质量,允许用户评估最终视频(gg)与学习内容(ff)之间的一致性。  

## 3. 两项评估的证据  

我们进行了一项多方法评估,以评估PedaCo框架的有效性,结合了以教育者为中心的人类研究(3.1)和通过自动化指标的算法评估(3.2)。这些评估共同为双重抵触层的价值提供了趋同证据。  

### 3.1. 教育者的发现  

我们对23位教育者进行了被试内研究,这些教育者事先已了解CTML原则,并直接使用我们的系统生成和评估视频。在系统的引导下,参与者通过输入原始学习内容,并利用系统的CTML反馈迭代优化AI生成的脚本,来模拟处理预生成的视频。然后,他们将这些视频结果与未遵循CTML指南生成的基准视频进行比较。主题涵盖三种不同的认知需求:因果推理、抽象概念和程序性知识。参与者根据涵盖所有12条CTML原则和整体教学有效性的13个项目对每种条件进行评分。  

基于审查的方法在每个原则上都带来了统计学上显著的改善(p<.05,Wilcoxon符号秩检验)。平均评分从5分制的3.07提升至3.86(+0.79,p<.01),在内容组织方面观察到最显著的提升:前提排序(+0.86)、无关材料删除(+0.84)和整体教学有效性(+0.96)。几乎所有效应都很大(r≥.64,按Z/√N计算),只有一个例外(冗余,r=.42,中等效应),且在性别和经验水平上保持一致。  

值得注意的是,教育者并不认为审查过程拖慢了他们。他们对生产效率的评分为4.26/5,对基于CTML指导的有效性评分为4.04/5(方差极低,SD=0.62)。一位参与者很好地捕捉到了这种张力:迭代过程“相当具有挑战性”,但最终“产出一个稳健且有效的学习工具”(P23)。另一位明确要求“提供单独的功能,让教师可以额外审查、编辑和修改”AI输出(P05)——换言之,需要更多而非更少的抵触。  

### 3.2. 指标的发现  

独立地,我们将自动化指标应用于一个包含14个视频(7个主题×2个条件)的语料库,这些视频取自经典的科学和哲学课程。视频以相同结构生成,将遵循CTML原则的生成和审查隔离为唯一变量。五个指标中有两个显示出显著改善:时间邻近性(0.294 vs. 0.273,p=.021)和一致性(0.729 vs. 0.646,p=.011)。其余三个指标无显著差异——模态和冗余在两种条件下得分都很高(接近上限),图像质量也无差异,因为两种条件使用了相同的视频合成模型。我们保留这些指标作为安全网:当前模型在这些维度上表现良好,但它们作为防护栏,防止未来模型退化或幻觉引发的故障。  

### 3.3. 两项评估一致之处  

支持我们双重层次方法的最有力证据是主观评分与客观指标之间的高度趋同。尽管两项评估使用了不同的样本和工具独立进行,但都识别出一致性和时间对齐是PedaCo流程提升最显著的维度。教育者将一致性列为三大改进之一,与自动化系统发现的统计学显著提升相符。这种三角测量表明,两个审查层并非仅仅是冗余,而是对相同的底层教学质量提供了互补验证。  

## 4. 讨论:重构教育AI中的“抵触”  

PedaCo框架为在教育场景中应为生成式AI划定何种界限提供了一个基于理论的视角。通过CTML实现“原则性抵制”,我们展示了有意的摩擦如何在维护教学完整性的同时,不边缘化教育者的专业权威。我们的发现表明,“建设性摩擦”在以下情况下最为有效:(a) 基于理论而非直觉;(b) 战略性地嵌入上游脚本阶段;(c) 在人类与计算代理之间混合应用。  

然而,这种双重审查方法为研讨会带来了三个浮现的张力点以供思考:  

- • 协商自主权:当自动标记与教育者的判断出现分歧时,界面应如何平衡算法保障与人类自主性?  
- • 摩擦的可持续性:虽然在我们短期研究中受到重视,但在日常课堂准备中进行迭代审查的长期可行性尚不清楚。我们必须确定建设性摩擦何时转变为“摩擦疲劳”。  
- • 超越代理指标:未来的研究必须超越理论代理,评估结构化抵制对学生学习成果的直接影响。  

## 5. 结论  

在本文中,我们主张教育AI需要结构化的方式来表达“尚未准备好”——弥合人类的教学专业知识与计算的精确性。我们的PedaCo框架通过在脚本阶段的教育者审查和视频阶段的自动化教学指标,将原则性抵制构建到视频生成流程中。初步证据表明,两个层次均提升了相同的教学维度,并且教育者将此摩擦体验为建设性的而非负担性的。我们将其作为对研讨会核心问题的具体回应之一:对教育中的AI的抵触不应等同于拒绝。相反,它可以意味着构建被设计为能够基于原则进行回驳,直至输出真正准备好用于教学的系统。  

###### 致谢  

本工作由韩国政府通过IITP(RS-2021-II211343)和KOCCA(RS-2024-00398320)资助。  

## 参考文献  

- Brookset al.(2024)T. Brooks, B. Peebles, C. Holmes, W. DePue, Y. Guo, L. Jing, D. Schnurr, J. Taylor, T. Luhman, E. Luhman, C. Ng, R. Wang, and A. RameshVideo generation models as world simulators。外部链接:Link (https://openai.com/research/video-generation-models-as-world-simulators) 被引用于:§1 (https://arxiv.org/html/2608.19812#S1.p1.1)。  
- DeepMind (2024)G. DeepMindVeo: google’s most capable generative video model。注:https://deepmind.google/models/veo/ 访问时间:2025-09-29 被引用于:§1 (https://arxiv.org/html/2608.19812#S1.p1.1)。  
- Mayer (2009)R. E. MayerMultimedia principle。收录于Multimedia Learning,第223–241页。被引用于:表1 (https://arxiv.org/html/2608.19812#S1.T1)、表1 (https://arxiv.org/html/2608.19812#S1.T1.4)、§1 (https://arxiv.org/html/2608.19812#S1.p2.1)。  
- Teamet al.(2023)G. Team, R. Anil, S. Borgeaud, J. Alayrac, J. Yu, R. Soricut, J. Schalkwyk, A. M. Dai, A. Hauth, K. Millican,et al.Gemini: a family of highly capable multimodal models。arXiv preprint arXiv:2312.11805。被引用于:§2.1 (https://arxiv.org/html/2608.19812#S2.SS1.p1.1)。

相似文章

我找到了对抗AI内容垃圾的方法

Reddit r/artificial

作者提出将AI作为研究筛选和综合工具,而非内容生成器,以对抗“AI内容垃圾”。通过构建一个比较并排名专家来源的自动化流程,作者认为未来人类在AI时代的主要角色将是策展人、筛选者和判断者。

致AI垃圾搬运工

Lobsters Hottest

一篇评论或批评文章,针对低质量的AI生成内容被大量制作和传播的问题。

我们为何构建

Reddit r/artificial

一篇观点文章,提倡构建能够从领域专家处提供透明、可验证知识的AI系统,从而实现基于发现的学习,并抵制集中式宣传。