long-form-video

标签

Cards List
#long-form-video

持久故事与交互式世界的长时间音视频生成

Hugging Face Daily Papers · 3天前 缓存

本文介绍了JoyAI-Echo-1.5,这是一个统一的音视频生成系统,适用于长视频和交互式世界,使用跨镜头记忆和几何感知控制来保持连贯性和持久性。

0 人收藏 0 人点赞
#long-form-video

ViSAGE:构建用于长视频理解的自我纠正记忆

arXiv cs.AI · 2026-08-03 缓存

ViSAGE是一个用于长视频理解的多模态智能体记忆框架,通过跨模态绑定、双向记忆精炼和多智能体交叉验证来构建自我纠正、以实体为中心的记忆,相比基线实现了5.9%的准确率提升。

0 人收藏 0 人点赞
#long-form-video

一次成片,灵活参考:Seedance 2.5 正式发布

Reddit r/singularity · 2026-08-02 缓存

字节跳动 Seed 正式发布 Seedance 2.5,这是一款新一代视频创作模型,支持30秒单次生成、多轮扩展、多模态参考和精准编辑能力,现已在 Jimeng AI 和 Doubao Pro 上推出。

0 人收藏 0 人点赞
#long-form-video

LiteFrame 扩展视频大语言模型效率(6分钟阅读)

TLDR AI · 2026-05-21 缓存

LiteFrame 为视频大语言模型引入了一种高效的视频编码器,采用压缩令牌蒸馏技术,在保持准确率的同时,能够处理多达8倍的帧数并降低35%的延迟,为长视频理解开创了新的帕累托前沿。

0 人收藏 0 人点赞
#long-form-video

LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers · 2026-05-17 缓存

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。

0 人收藏 0 人点赞
#long-form-video

OmniScript:面向长篇幅电影视频的视听脚本生成

Hugging Face Daily Papers · 2026-04-13 缓存

# 论文页面 - OmniScript:面向长篇幅电影视频的视听脚本生成 来源:[https://huggingface.co/papers/2604.11102](https://huggingface.co/papers/2604.11102) ## 摘要 本文提出了一项新颖的视频到脚本任务,并同步介绍了 OmniScript——一个 80 亿参数的全模态语言模型,该模型通过渐进式流水线技术训练,用于长篇幅叙事理解与时间定位。当前的[多模态大语言模型](https://huggingface.co/papers?

0 人收藏 0 人点赞
← 返回首页

提交意见反馈