audio-visual-generation

Tag

Cards List
#audio-visual-generation

Open Omnimodal World Models (GitHub Repo)

TLDR AI · yesterday Cached

JoyAI-Echo is an open-source GitHub repository that provides long-horizon audio-visual generation and omnimodal world models for creating persistent stories and interactive worlds.

0 favorites 0 likes
#audio-visual-generation

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

Hugging Face Daily Papers · 3d ago Cached

This paper presents JoyAI-Echo-1.5, a unified audio-visual generation system for long-form video and interactive worlds, using cross-shot memory and geometry-aware control to maintain coherence and persistence.

0 favorites 0 likes
#audio-visual-generation

EchoWM: Open and Enterable Omnimodal World Models

Hugging Face Daily Papers · 3d ago Cached

EchoWM introduces an open omnimodal world model that generates synchronized video, sound, music, and speech with continuous 6-DoF navigation for enterable generative media.

0 favorites 0 likes
#audio-visual-generation

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

Hugging Face Daily Papers · 2026-05-25 Cached

LongAV-Compass is a comprehensive benchmark for evaluating minute-long audio-visual generation across text, image, and video conditioning modalities, assessing quality, consistency, and alignment over extended temporal sequences.

0 favorites 0 likes
← Back to home

Submit Feedback