Light Interaction: 用于交互式视频世界模型的无训练推理加速
摘要
Light Interaction 提出了一种用于交互式视频世界模型的无训练推理加速框架,采用自适应上下文管理、去噪缓存加速和3D块稀疏注意力,实现了高达2.59倍的速度提升,同时保持了有竞争力的视觉质量。
查看缓存全文
缓存时间: 2026/06/01 03:17
论文页 - Light Interaction: 面向交互式视频世界模型的免训练推理加速
来源:https://huggingface.co/papers/2605.31158
摘要
Light Interaction 通过自适应计算策略和优化注意力机制来加速交互式视频世界模型,且无需重新训练模型。
交互式视频世界模型能够根据用户控制的摄像头运动,逐块生成视频内容,从而支持实时游戏模拟、虚拟场景导航和具身人工智能训练等应用。然而,由于上下文记忆不断增长、注意力机制复杂度呈二次方增长以及重复的去噪步骤,扩展到长交互轨迹的代价极其高昂。我们提出 Light Interaction,这是一个面向交互式视频世界模型的免训练推理加速框架。我们的核心见解是:交互本身自然支持轨迹相关的自适应计算——在探索新区域时可丢弃检索到的空间记忆,可根据局部潜在动态调整时间上下文,当摄像头重新访问熟悉区域时可复用早期步骤的模型输出。基于这一见解,Light Interaction 结合了自适应上下文管理、去噪缓存加速,以及硬件与软件协同设计的、融合 Triton 内核的 3D 块稀疏注意力。在 HY-WorldPlay 和 Matrix-Game-3.0 上的评估表明,Light Interaction 无需模型重新训练即可实现高达 2.59 倍的加速,同时保持有竞争力的视觉质量。
查看 arXiv 页面 (https://arxiv.org/abs/2605.31158) 查看 PDF (https://arxiv.org/pdf/2605.31158) 项目页面 (https://2843721358l-del.github.io/Light-Interaction-Project/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31158)
在你的 agent 中获取此论文:
hf papers read 2605.31158
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.31158 即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.31158 即可从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.31158 即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
@FinanceYF5:使用fal运行这个24小时不间断AI直播每天成本约3,450美元;切换到Seedance,同样的c…
本文对比了使用fal和Seedance进行AI直播的日均成本,指出fal便宜约10倍,并且在文生视频性能上表现优异。
基于世界模型的潜能量行动规划
介绍了潜能量行动规划(LEAP),该方法通过冻结的世界模型优化行动序列,以改善目标条件控制,在四个控制领域中实现成功率提高17.3个百分点。
语义贝叶斯世界模型
本文提出了语义贝叶斯世界模型(SBWMs),旨在弥合知识图谱的精确断言与基础模型的概率推理之间的鸿沟,实现共享且不断演化的信念网络,以在不确定性下进行统一推理。
为安全关键具身系统重新思考世界模型
本文提出一种风险感知世界模型(RIWM),通过优先考虑与决策相关的后果和恢复,而非预测可能性,以增强关键具身系统的安全性。
边距而非窗口:无训练的每步有损推测解码
AdaptiveSpec是一种无训练的每步推测解码方法,它自适应调整令牌验证和草稿树形状以提升LLM推理吞吐量,在基准测试中提高性能高达56%的同时保持高准确性。