LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

Hugging Face Daily Papers 论文

摘要

LynnReal-Omni 是一个统一的多模态视频扩散框架,它将智能体视觉控制与高保真生成和实时加速相结合,以实现稳定、可控的视频创作。

视频扩散模型是随机且难以控制的:精确内容通常需要重复采样而无法保证成功,长场景在外观、交互和时间连贯性上会出现漂移。智能体视觉创作提供显式参考、可编辑的3D场景或可执行的游戏状态以实现稳定控制,但本身并不保证高物体或角色保真度。结合两者可以实现稳定、高质量的生成。为了实现这种结合,我们推出了LynnReal-Omni,一个基于32B共享多模态扩散变换器的原生多模态视频生成框架,统一了文本到视频、图像条件生成、参考引导生成、结构控制、编辑、退化视频修复和长视频生成。它接受异构的视觉输入,包括外观参考、可编辑的3D渲染和游戏录制,允许智能体在统一模型中组合视觉条件。我们还训练了一个专用的27B Flash共享多模态扩散变换器用于实时渲染。我们构建了一个系统化的数据流水线,用于视频清理、主体关联、多模态注释和对齐控制构建,产生了一个精心策划的多镜头视听片段语料库,并引入了MSAVP,一个包含100个提示、20个指标的评估设计,分离了指令遵循、生成合理性、视觉质量、时间行为和音频协调。LynnReal-Omni-Flash通过模型和解码加速进一步降低了推理成本,包括轻量级VAE解码器;在一块H100上,LynnReal-Omni的22帧540p视频的热生成和解码需要843毫秒,而Flash仅需377毫秒。这些结果为实时流式视频生成奠定了基础,使LynnReal-Omni成为智能体视觉创作的统一、可控且高效的基础。
查看原文
查看缓存全文

缓存时间: 2026/09/15 10:40

论文页面 - LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

来源:https://huggingface.co/papers/2609.15863

摘要

LynnReal-Omni 是一个统一的多模态视频扩散框架,它将智能体视觉控制与高保真生成及实时加速相结合。

视频扩散模型具有随机性且难以控制:精确的内容通常需要重复采样但无法保证成功,而长时序场景在外观、交互和时间连贯性上容易产生漂移。智能体视觉创作通过提供明确的参考、可编辑的3D场景或可执行的游戏状态来实现稳定控制,但其本身并不能保证高精度的物体或角色保真度。将两者结合可以实现稳定且高质量的生成。为了实现这种结合,我们推出了 LynnReal-Omni,这是一个基于32B共享多模态扩散变压器的原生多模态视频生成框架,它统一了文本到视频、图像条件生成、参考引导生成、结构控制、编辑、低质量视频修复以及长视频生成等功能。它接受异构的视觉输入,包括外观参考、可编辑的3D渲染和游戏录像,允许智能体在单一模型内组合视觉条件。我们还训练了一个专门的27B Flash共享多模态扩散变压器,用于实时渲染。我们构建了一个系统性的数据管道,用于视频清洗、主体关联、多模态标注和对齐控制构建,最终生成了一个精选的多镜头视听片段语料库,并引入了 MSAVP,这是一个包含100个提示、20项指标的评估设计,旨在分别评估指令遵循度、生成合理性、视觉质量、时间行为和音频协调性。LynnReal-Omni-Flash 通过模型和解码加速进一步降低了推理成本,包括一个轻量级的 VAE 解码器;在单个 H100 上,生成并解码一个22帧540p视频,LynnReal-Omni 需要843毫秒,而 Flash 仅需377毫秒。这些结果为实时流式视频生成奠定了基础,使 LynnReal-Omni 成为智能体视觉创作一个统一、可控且高效的基石。

查看 arXiv 页面 (https://arxiv.org/abs/2609.15863) 查看 PDF (https://arxiv.org/pdf/2609.15863) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.15863)

将此论文加入你的智能体:

hf papers read 2609\.15863

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.15863 以将其链接到此页面。

引用此论文的数据集0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.15863 以将其链接到此页面。

引用此论文的 Spaces0

没有 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.15863 以将其链接到此页面。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

LoomVideo:统一多模态输入的视频生成与编辑

Hugging Face Daily Papers

LoomVideo提出了一种5B参数的统一架构用于视频生成和编辑,通过新颖的条件机制和多模态对齐减少计算开销,实现了具有竞争力的性能和更快的推理速度。

CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。