HelloWorld:在视频世界模型中实现社交互动角色
摘要
HelloWorld是一个视频世界模型,支持社交互动角色,用户只需按一次按钮即可提示屏幕上的角色做出回应。它利用自蒸馏和无训练交叉注意力掩码来使互动自然化,并引入了用于评估的HelloWorldBench。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - HelloWorld:在视频世界模型中实现社交互动角色
来源:https://huggingface.co/papers/2608.05070
摘要
尽管视频世界模型近期取得了显著进展,但用户与这些世界中的角色之间的社交互动仍不受支持。为了填补这一空白,我们提出了 HelloWorld,一种视频世界模型,能够实现与世界中角色的社交互动。只需按一下按钮,用户即可提示屏幕上的角色面向摄像头做出响应,例如转向观看者、挥手、点头或说一句简短的问候。为了使这些互动自然,我们提出了一种自蒸馏管道,在模型自身合成的数据上微调视频生成模型。每个合成的片段既包含社交互动,也包含相机运动,使模型能够学习相机姿态条件而不会降低互动质量。在推理时,我们进一步引入了一个免训练模块,用于确定互动发生的时间。在按钮按下时,它会调节 DiT 的交叉注意力掩码,使得与互动相关的文本提示仅关注按下窗口内的帧,从而在时间上定位角色的响应。我们还构建了 HelloWorldBench,一个包含 400 个样本的基准,附带三个社交互动指标以及三个常规指标,用于评估。实验表明,HelloWorld 在互动质量上超越了多种基线,同时保持了最先进的画面美学和相机姿态跟随。项目页面:https://github.com/AlayaLab/HelloWorld
查看 arXiv 页面 查看 PDF GitHub1 添加到收藏
在您的 agent 中获取此论文:
hf papers read 2608\.05070
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.05070,即可从此页面链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.05070,即可从此页面链接到该数据集。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.05070,即可从此页面链接到该 Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏,即可从此页面链接到该收藏。
相似文章
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。
无限世界与多样交互
本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。
AlayaWorld: 交互式长视界世界建模 -- 完整技术报告
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
tencent/HY-World-2.0
HY-World 2.0 是腾讯开源的跨模态3D世界模型,能够从文本、图像和视频中重建和生成3D世界,生成可编辑的3D资产(网格/高斯泼溅),效果与闭源方法相当。
DreamX-World 1.0: 通用交互式世界模型
DreamX-World 1.0 是一个通用的交互式文本/图像到视频世界模型,支持相机导航、场景持久化和跨多个领域的可提示事件,利用 E-PRoPE、因果强制和记忆条件场景持久化等新技术实现可控的长时程生成。