OSCBench: 文本到视频生成中的对象状态变化基准测试

arXiv cs.CL 论文

摘要

OSCBench是一个新的基准测试,用于评估文本到视频生成模型准确表示对象状态变化(由剥皮或切片等动作引起的转变)的能力。该论文表明,当前的T2V模型在处理时间上一致的状态变化方面存在困难,特别是在新颖和组合场景中,这被认定为视频生成的一个关键瓶颈。

arXiv:2603.11698v2 宣布类型:交叉替换 摘要:文本到视频(T2V)生成模型在生成视觉高质量和时间连贯的视频方面取得了快速进展。然而,现有基准主要关注感知质量、文本-视频对齐或物理合理性,留下了动作理解的一个关键方面基本未被探索:文本提示中明确指定的对象状态变化(OSC)。OSC是指由动作引起的对象状态的转变,例如剥土豆或切柠檬。在本论文中,我们引入了OSCBench,一个专门为评估T2V模型中的OSC性能而设计的基准。OSCBench由烹饪教学数据构建而成,并系统地将动作-对象交互组织为常规、新颖和组合场景,以探测分布内性能和泛化能力。我们使用人类用户研究和基于多模态大语言模型(MLLM)的自动评估方法评估了六个代表性的开源和专有T2V模型。我们的结果表明,尽管在语义和场景对齐方面表现强劲,但当前T2V模型在准确和时间一致的对象状态变化方面持续面临困难,特别是在新颖和组合设置中。这些发现将OSC确立为文本到视频生成的关键瓶颈,并将OSCBench确立为推进状态感知视频生成模型的诊断基准。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:33

# OSCBench:文本到视频生成中的对象状态变化基准测试

来源:https://arxiv.org/html/2603.11698

Xianjing Han1\*,Bin Zhu2\*†,Shiqi Hu1,Franklin Mingzhe Li3,Patrick Carrington3,Roger Zimmermann1,Jingjing Chen4

1新加坡国立大学
2新加坡管理大学
3卡内基梅隆大学
4复旦大学

通讯作者:binzhu@smu\.edu\.sg (https://arxiv.org/html/2603.11698v2/mailto:[email protected])

###### 摘要

文本到视频(T2V)生成模型在生成视觉高质量和时间连贯的视频方面取得了快速进展。然而,现有基准测试主要关注感知质量、文本-视频对齐或物理可信度,而对行为理解的一个关键方面——文本提示中明确指定的对象状态变化(OSC)——探索不足。OSC 是指由行为引起的对象状态转变,例如削土豆皮或切柠檬。本文介绍 OSCBench,一个专门设计用于评估 T2V 模型中 OSC 性能的基准测试。OSCBench 由指导性烹饪数据构建而成,并将行为-对象交互系统地组织为常规、新颖和组合场景,以探测分布内性能和泛化能力。我们使用人类用户研究和基于多模态大语言模型(MLLM)的自动评估来评估六个代表性的开源和专有 T2V 模型。结果表明,尽管在语义和场景对齐方面表现良好,当前 T2V 模型在准确和时间一致的对象状态变化方面始终存在困难,特别是在新颖和组合设置中。这些发现将 OSC 确立为文本到视频生成的关键瓶颈,并将 OSCBench 设立为推进状态感知视频生成模型的诊断基准。项目页面:https://hanxjing.github.io/OSCBench。

OSCBench:文本到视频生成中的对象状态变化基准测试

Xianjing Han1\*,Bin Zhu2\*†,Shiqi Hu1,Franklin Mingzhe Li3,Patrick Carrington3,Roger Zimmermann1,Jingjing Chen4

1新加坡国立大学
2新加坡管理大学
3卡内基梅隆大学
4复旦大学

通讯作者:binzhu@smu\.edu\.sg (https://arxiv.org/html/2603.11698v2/mailto:[email protected])

11脚注:\*等额贡献。
22脚注:†通讯作者和项目负责人。

参考图片

**图 1:** OSCBench 评估概览。(a)来自常规、新颖和组合对象状态变化场景的代表性失败案例。在常规案例中,红色框标记了切割时柠檬状态变化的不可信性。在新颖案例中,模型误解了指导性行为,导致对象转变错误。在组合案例中,黄色框表示梨未完全去皮的不完整状态变化。(b)T2V 模型在 OSCBench 上的人类评估多维性能。

## 1 引言

文本到视频(T2V)生成模型近年来取得了显著进展,生成的视频具有越来越高的视觉保真度和时间连贯性。这些进展支撑了广泛的应用,包括创意内容生成、教学视频合成和真实世界过程模拟(Google DeepMind,2025b;Ma 等,2025)。随着 T2V 模型继续扩展,一个中心问题应运而生:这些模型在多大程度上忠实地实现了语言中指定的行为的后果(Pearl,2009;Zhu 和 Ngo,2020;Souček 等,2024),而不是仅仅生成视觉上吸引人的运动模式?

近期基准测试通过评估物理可信度和常识约束来解决这个问题,例如重力遵循、碰撞和材料特性(Meng 等,2024;Gu 等,2025)。虽然这些评估探测了物理写实主义的基本方面,但它们忽略了语言基础行为理解的一个关键维度,这在日常活动中无处不在:文本提示明确指定的对象状态变化(OSC)。

在许多真实任务中,例如切柠檬、削胡萝卜或揉面团,成功的定义不仅在于执行行为,还在于将对象从初始状态转变为特定的目标状态(例如,整个柠檬变成切好的柠檬)(Souček 等,2022;Xue 等,2024;Li 等,2025)。正确建模对象状态变化对下游应用至关重要,包括机器人学、体现 AI 和教学视频生成。

对象状态变化对 T2V 模型中的语言基础推理提出了特别严格的测试。正确的 OSC 生成要求模型理解语言中表达的行为语义、推断预期的对象转变,并随时间呈现连续且连贯的视觉演进。然而,尽管生成在视觉上引人注目的视频,当前 T2V 模型往往在此维度上失败:生成的输出乍一看可能看起来逼真,但却显示错误、不完整或不一致的对象状态变化。图 1(a)展示了代表性的失败案例,其中对象变为不合理的状态或指导性行为被误解,揭示了高级别语义对齐与忠实实现行为后果之间的差距。

尽管 OSC 的重要性,它并未在现有 T2V 基准测试中得到系统评估。现有基准测试主要强调整体感知质量、文本-视频对齐或物理可信度,而没有明确评估对象是否达到了正确的目标状态或状态转变是否在整个时间内一致展开。

为了弥补这一空缺,我们引入 OSCBench,一个专门为评估文本到视频生成中的对象状态变化而设计的基准测试。我们专注于教学烹饪场景,在这些场景中状态变化频繁、多样且定义明确,并在 HowToChange 数据集(Xue 等,2024)基础上构建 OSCBench。为了实现平衡和全面的评估,我们将行为和对象抽象为语义上有意义的类别,然后构建三个互补的评估体系,如图 1(a)所示:

- 常规场景:覆盖常见的行为-对象对(例如,切柠檬)
- 新颖场景:测试不常见但可行的状态变化的泛化(例如,捣碎葡萄柚)
- 组合场景:涉及多个行为组合(例如,削梨皮并切片)

总的来说,OSCBench 包含跨 140 个对象状态场景的 1,120 个提示,为评估 T2V 模型中的 OSC 性能提供了特定的基准测试。

此外,我们在 OSCBench 上评估了六个最先进(SOTA)的 T2V 模型,包括四个广泛使用的开源系统(Open-Sora-2.0、HunyuanVideo、HunyuanVideo-1.5、Wan-2.2)和两个专有模型(Kling-2.5-Turbo 和 Veo-3.1-Fast)。我们进行了人类用户研究和使用最新多模态大语言模型(MLLM)的自动评估。在两种评估方法中,我们设计了涵盖语义遵循、OSC 性能、场景对齐和感知质量的全面标准集。特别是,我们不是将 MLLM 用作黑盒评分器,而是采用思维链(CoT)评估策略,通过标准接地、证据提取和分数正当化来明确指导推理过程。我们进一步分析了人类判断与基于 MLLM 的评估之间的相关性,以评估自动 OSC 评估的可靠性。

图 1(b)中的结果表明,虽然 SOTA T2V 模型通常在高级别语义对齐方面表现良好(例如,主体、对象和场景),但对象状态变化的准确性和一致性仍然是一个重大挑战。这些发现将 OSC 确立为一个关键的诊断维度,补充了现有评估。通过揭示状态变化如何偏离预期的行为效果,OSCBench 为构建关于行为及其后果进行更忠实推理的视频生成模型提供了实际指导。

总之,我们的贡献包括三个方面:

- •我们引入 OSCBench,第一个专门设计用于评估文本到视频生成中对象状态变化的基准测试,涵盖常规、新颖和组合场景。
- •我们设计了一套标准,涵盖语义遵循、OSC 性能、场景对齐和感知质量,通过人类用户研究和自动 MLLM 评估来全面评估视频生成性能。
- •我们为六个 SOTA T2V 模型进行了基准测试,系统地检查了它们在不同 OSC 场景中的性能,并确定了仍然存在的关键挑战。结果为设计具有 OSC 感知生成的模型提供了指导,并为未来研究勾勒了方向。

## 2 相关工作

**文本到视频生成的基准测试。** T2V 模型的快速进展激发了对准确和可靠评估的基准测试的开发。许多最近的基准测试(Huang 等,2024;He 等,2024)旨在从综合角度或通过生成质量的特定方面来提供 T2V 模型的系统评估。例如,VBench(Huang 等,2024)和 Eval-Crafter(Liu 等,2024)针对多个可解释维度的整体评估,包括时间一致性、运动平滑性和文本-视频对齐。

为了更好地诊断特定的建模挑战,已经提出了若干方面特定的基准测试。例如,T2V-CompBench(Sun 等,2025)评估组合生成能力,而 DEVIL(Liao 等,2024)关注生成视频的动态特性。最近,研究人员观察到 T2V 模型频繁生成违反物理约束的视频。这激发了显式评估物理可信度的基准测试的开发,例如 VideoPhy(Bansal 等,2024)、PhyGenBench(Meng 等,2024)和 PhyWorldBench(Gu 等,2025),它们检查生成的视频是否遵守基本物理常识。

尽管取得了这些进展,现有基准测试对 OSC 的关注有限。在本工作中,我们引入了一个专门针对对象状态变化的基准测试,提供需要准确状态建模的场景,并能够对模型的 OSC 理解进行有针对性的评估。

**文本到视频模型的评估方法。** 最近的视频基准测试(Huang 等,2024;Meng 等,2024;Gu 等,2025)通常采用混合评估方案,将自动模型评估与人类用户研究相结合。对于自动评估,广泛使用基于 CLIP(Xue 等,2024)和 ViCLIP(Wang 等,2023)的文本-视频相似度模型来评估提示和生成视频之间的语义对齐。最近,MLLM 在理解复杂视觉内容方面表现出了强大的能力(Ouyang 等,2025;Zhang 等,2025;He 等,2025)。因此,许多视频基准测试(Feng 等,2025;Motamedi 等,2025;Han 等,2025)使用 MLLM 来评估生成视频中的语义一致性。基于这种能力,PhyWorldBench(Gu 等,2025)进一步利用 MLLM 来评估生成的视频是否遵守物理定律,这通常需要多步推理。

为了评估细粒度的 OSC,我们利用 MLLM 的推理能力并采用 CoT 策略(Wei 等,2022)。与主要使用 CoT 生成文本描述的现有基准测试(Gu 等,2025)不同,我们使用它来指导模型通过结构化的推理过程,鼓励仔细的视觉检查和更可靠的状态变化判断。

**图 2:** OSCBench 构建和评估管道概览。我们通过人工参与过程从指导性烹饪数据构建统一的行为和对象类别,并将常规、新颖和组合 OSC 场景构造为视频生成的文本提示。生成的视频由人类和 MLLM 根据多个标准进行评估,我们分析它们的相关性以评估自动 OSC 评估的可靠性。

## 3 OSCBench 构建

OSCBench 的目标是为评估文本到视频生成中的对象状态变化提供一个结构化和全面的基准测试。设计这样的基准测试需要解决三个关键挑战:(i)涵盖植根于文本提示的真实且多样的对象状态变化,(ii)确保行为和对象的受控和平衡覆盖以减少数据集偏见,以及(iii)引入不同的难度级别以探测记忆和泛化。本节描述如何构建 OSCBench 以满足这些要求。

### 3.1 数据源和抽象

对象状态变化在日常活动中无处不在,烹饪是一个代表性的领域。烹饪任务自然涉及多样的状态转变,例如切割、削皮和加热,并展示了行为和结果对象状态之间的清晰因果关系。因此,我们在 HowToChange 数据集(Xue 等,2024)的基础上构建 OSCBench,该数据集来自 HowTo100M(Miech 等,2019)中的教学烹饪视频。HowToChange 包含 20 个细粒度的行为元素和 134 个对象元素,产生了 409 个不同的行为-对象组合(例如,切苹果)。然而,这些组合展现了强烈的长尾分布:常见对(例如,切土豆)出现频繁,而许多可行的对很少见。

相似文章

MemoBench:动态变化环境中世界建模的基准测试

Hugging Face Daily Papers

MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。

CRONOS:评估视频模型中反事实物理一致性的基准

Hugging Face Daily Papers

CRONOS是一个基准测试,通过在保持物理事件类型不变的情况下对视角、场景、物体类别和外观进行干预,来评估视频预测模型的反事实物理一致性。它揭示了当前视频生成器的重大缺陷。