long-video

标签

Cards List
#long-video

CoEvoWhen:面向超长视频时间定位的策略-工具协同进化

Hugging Face Daily Papers ↗ · 2天前 缓存

CoEvoWhen 提出了一种策略-工具协同进化框架,通过 VLM 智能体推理轨迹共同进化高层策略与可执行的媒体工具,在无需更新模型参数的情况下提升超长视频时间定位能力。

0 人收藏 0 人点赞
#long-video

开源全模态世界模型(GitHub仓库)

TLDR AI ↗ · 2026-08-26 缓存

JoyAI-Echo是一个开源的GitHub仓库,提供长期音视频生成和全模态世界模型,用于创建持久故事和交互式世界。

0 人收藏 0 人点赞
#long-video

NARU:一个针对日本超长视频中叙事演进和文化细微差理解的基准

Hugging Face Daily Papers ↗ · 2026-08-13 缓存

NARU 是一个评估日本超长视频中叙事演进和文化推理的基准,通过分层标注管道和母语者验证构建,以解决当前基准的空白。

0 人收藏 0 人点赞
#long-video

SCOUT:用于超长自我中心视频推理的自检查与恢复感知工具思维智能体

arXiv cs.AI ↗ · 2026-08-11 缓存

SCOUT 提出了一种恢复感知的智能体框架,采用自适应探索-利用策略,用于超长自我中心视频推理。该框架通过 UPS-GRPO 训练,这是一种不确定性优先的强化学习方法,具备回合级优势分解。它在超长自我中心基准上取得了最先进的结果,并在较短的长时间视频场景中保持竞争力。

0 人收藏 0 人点赞
#long-video

自梯度强制:原生长视频外推

Papers with Code Trending ↗ · 2026-07-22 缓存

提出自梯度强制(SGF),一种用于自回归视频扩散模型的双通训练策略,为写入有用的上下文记忆提供缺失的监督,即使在短训练窗口下也能实现强大的长视频外推。

0 人收藏 0 人点赞
#long-video

@svpino: 这个模型能够生成连贯的、跨越多个场景的长达1小时以上的视频,毫无卡顿。我读了他们的论文,所以…

X AI KOLs Following ↗ · 2026-07-13 缓存

这条推文介绍了LingBot-World-Infinity,一个开放权重的视频生成模型,它采用一种训练技术来从错误中恢复,从而能够生成跨越多个场景的连贯的1小时视频。

0 人收藏 0 人点赞
#long-video

OPSD-V: 面向后训练少步自回归视频生成器的在线策略自蒸馏

Hugging Face Daily Papers ↗ · 2026-07-09 缓存

OPSD-V 通过使用真实长视频数据作为训练时的时间上下文,提供密集的轨迹级监督,从而增强视觉质量和运动动态,同时不改变推理机制,改进了少步自回归视频扩散模型。

0 人收藏 0 人点赞
#long-video

@IndieDevHailey: 港大开源 ViMax,AI 一人剧组,一键拍完整长视频! 一句话想法 → 自动生成带剧本、分镜、配音、角色一致的成片! 解决下面的痛点: - 不再几秒短 clip、人物跳脸 - 多 Agent 协作:编剧写故事、导演控镜头、制片保一致、生…

X AI KOLs Timeline ↗ · 2026-07-06 缓存

港大开源 ViMax,一个多智能体协作的长视频生成工具,能从一句话生成带剧本、分镜、配音、角色一致的连贯视频,解决短视频碎片化和角色不一致等问题。同时开发者还介绍了Taste-Skill,一个提升AI生成界面审美的前端框架。

0 人收藏 0 人点赞
#long-video

@VraserX: Seedance 2.5 能够一次性生成长达3分钟的连贯视频,实在是太疯狂了。如果这个速度继续下去,我们很快就会……

X AI KOLs Following ↗ · 2026-07-03 缓存

Seedance 2.5 能够一次性生成长达3分钟的连贯AI视频,标志着AI视频生成的重大飞跃,很快可能带来电视剧集和长片电影。

0 人收藏 0 人点赞
#long-video

重新思考长视频中的RAG:检索什么以及如何使用?

arXiv cs.AI ↗ · 2026-06-12 缓存

本文介绍了V-RAGBench,一个用于评估长自我中心视频中检索增强生成的基准,以及CARVE,一种自适应地为每个片段选择检索配置以提升VideoRAG性能的方法。

0 人收藏 0 人点赞
#long-video

OmniMem: 面向流式音视频大模型的扰动感知记忆压缩

arXiv cs.AI ↗ · 2026-06-09 缓存

OmniMem 引入了一种面向流式音视频大模型的模态感知记忆分配与扰动感知选择策略,在长视频基准测试上相比压缩基线实现了2-4%的绝对准确率提升。

0 人收藏 0 人点赞
#long-video

@yukangchen_: 很高兴分享我们的新博客:利用并行化扩展视频训练 https://research.nvidia.com/labs/eai/blogs/scali…

X AI KOLs Following ↗ · 2026-06-08 缓存

这篇来自NVIDIA Research的博客讨论了序列并行化如何扩展长视频训练系统,既支持理解任务也支持生成任务,解决了在多GPU上适配超长视频序列的挑战。

0 人收藏 0 人点赞
#long-video

jdopensource/JoyAI-Echo

Hugging Face Models Trending ↗ · 2026-06-02 缓存

京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。

0 人收藏 0 人点赞
#long-video

LongLive-RAG:一种通用的检索增强长视频生成框架

Hugging Face Daily Papers ↗ · 2026-06-01 缓存

LongLive-RAG将长视频生成形式化为检索增强生成问题,利用先前生成潜变量的动态记忆来减少误差积累和身份漂移,在多种自回归骨干网络上提升了生成质量。

0 人收藏 0 人点赞
#long-video

LVSA: 用于长视频扩散的无训练稀疏注意力

Hugging Face Daily Papers ↗ · 2026-05-29 缓存

LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。

0 人收藏 0 人点赞
#long-video

Keye-VL-2.0-30B-A3B —— 首次将DSA注意力引入多模态

Reddit r/LocalLLaMA ↗ · 2026-05-26

快手发布Keye-VL-2.0-30B-A3B,这是一款30B级多模态基础模型,首次将DSA注意力引入多模态领域,专注于长视频理解与智能体能力。

0 人收藏 0 人点赞
#long-video

实时长视频生成(GitHub仓库)

TLDR AI ↗ · 2026-05-20 缓存

NVlabs 发布了 LongLive 2.0,这是一个采用 NVFP4 量化的实时长视频生成并行基础设施,同时支持训练和推理。它达到了 45.7 FPS,并被 ICLR 2026 接收。

0 人收藏 0 人点赞
#long-video

长视频生成(阅读时间 4 分钟)

TLDR AI ↗ · 2026-05-12 缓存

本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈