long-form-video

Tag

Cards List
#long-form-video

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

Hugging Face Daily Papers · 3d ago Cached

This paper presents JoyAI-Echo-1.5, a unified audio-visual generation system for long-form video and interactive worlds, using cross-shot memory and geometry-aware control to maintain coherence and persistence.

0 favorites 0 likes
#long-form-video

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

arXiv cs.AI · 2026-08-03 Cached

ViSAGE is a multimodal agentic memory framework for long-form video understanding that builds self-correcting, entity-centric memories via cross-modal binding, bidirectional memory refinement, and multi-agent cross-verification, achieving 5.9% higher accuracy than baselines.

0 favorites 0 likes
#long-form-video

One-take Creation, Flexible Referencing: Introducing Seedance 2.5

Reddit r/singularity · 2026-08-02 Cached

ByteDance Seed officially launches Seedance 2.5, a new-generation video creation model with 30-second single-pass generation, multi-round extensions, multimodal referencing, and precise editing capabilities, now rolling out on Jimeng AI and Doubao Pro.

0 favorites 0 likes
#long-form-video

LiteFrame Scales Video LLM Efficiency (6 minute read)

TLDR AI · 2026-05-21 Cached

LiteFrame introduces a highly efficient video encoder for Video LLMs that uses Compressed Token Distillation to enable up to 8x more frames and 35% latency reduction while maintaining accuracy, setting a new Pareto frontier for long-form video understanding.

0 favorites 0 likes
#long-form-video

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

Hugging Face Daily Papers · 2026-05-17 Cached

LiteFrame proposes a lightweight video encoder with Compressed Token Distillation training that reduces latency and enables processing 8x more frames for long-form video understanding in Video LLMs, improving accuracy while reducing compute.

0 favorites 0 likes
#long-form-video

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

Hugging Face Daily Papers · 2026-04-13 Cached

This paper introduces OmniScript, an 8B-parameter omni-modal (audio-visual) language model for a novel video-to-script (V2S) task that generates hierarchical, scene-by-scene scripts from long-form cinematic videos. Trained via progressive pipeline techniques including chain-of-thought SFT and reinforcement learning with temporally segmented rewards, OmniScript outperforms larger open-source models and rivals proprietary models like Gemini 3-Pro.

0 favorites 0 likes
← Back to home

Submit Feedback