audio-video-generation

Tag

Cards List
#audio-video-generation

@rohanpaul_ai: A really cool real-time video models for interactive characters and worlds just launched. A1 doesn't generate a voice a…

X AI KOLs Following ↗ · yesterday Cached

Vivix.AI launched A1, a real-time video model for interactive characters and worlds that generates audio and video together in small consecutive segments, enabling seamless interruption and live, long-form conversation with persistent state.

0 favorites 0 likes
#audio-video-generation

AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation

Hugging Face Daily Papers ↗ · 2026-09-24 Cached

The paper proposes AV-GRPO, a modality-anchored reinforcement learning framework for joint audio-video generation that improves generation quality, semantic alignment, and cross-modal synchronization over existing methods.

0 favorites 0 likes
#audio-video-generation

The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

Hugging Face Daily Papers ↗ · 2026-09-02 Cached

Temporal Context Routing improves script-aligned timing in joint audio-video generation by mapping script timing onto shared video-audio temporal axes, reducing errors in shot boundaries and dialogue.

0 favorites 0 likes
#audio-video-generation

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

Hugging Face Daily Papers ↗ · 2026-08-31 Cached

DreamX-Creator 1.0 is a compact 7B native joint audio-video generator that uses cross-modal attention, progressive training, and reinforcement learning to produce synchronized 2K resolution outputs, aiming to democratize high-quality audio-video generation.

0 favorites 0 likes
#audio-video-generation

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

arXiv cs.AI ↗ · 2026-08-28 Cached

Multi2AV-Safety is the first benchmark for evaluating safety in multimodal-to-audio-Video generation, covering all 11 non-singleton conditioning configurations with 11,024 attack instances, and revealing compositional risks where harmful semantics emerge from benign inputs.

0 favorites 0 likes
#audio-video-generation

lightx2v/MiniMax-H3-Prompt-Rewriter-LoRA

Hugging Face Models Trending ↗ · 2026-08-07 Cached

LightX2V releases an open, local LoRA prompt rewriter for MiniMax-H3 text-to-audio-video generation, fine-tuned on Qwen3.6-27B to expand short prompts into structured audio-video descriptions.

0 favorites 0 likes
#audio-video-generation

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

Hugging Face Daily Papers ↗ · 2026-07-15 Cached

This paper introduces MultiRef-Compass, a comprehensive benchmark for multi-reference-to-audio-video generation, comprising 350 curated samples and an evaluation protocol with four dimensions including Basic Quality, Reference Consistency, Audio-Visual Consistency, and Instruction Following.

0 favorites 0 likes
#audio-video-generation

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

Hugging Face Daily Papers ↗ · 2026-06-29 Cached

AVTok proposes a unified 1D tokenizer for audio-video generation using a dual-stream transformer with shared encoder-decoder and modal-specific queries, achieving compact latent representations and excelling in reconstruction and downstream generation tasks.

0 favorites 0 likes
#audio-video-generation

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

Hugging Face Daily Papers ↗ · 2026-05-19 Cached

MSAVBench is the first comprehensive benchmark and adaptive evaluation framework for multi-shot audio-video generation, assessing 19 models across diverse tasks and achieving high alignment with human judgment.

0 favorites 0 likes
#audio-video-generation

Lightricks/LTX-2

GitHub Trending (daily) ↗ · 2026-06-18 Cached

LTX-2 is the first DiT-based audio-video foundation model from Lightricks, offering synchronized audio and video generation, high fidelity, and production-ready outputs, with open-source code and open model weights.

0 favorites 0 likes
← Back to home

Submit Feedback