diffusion-transformer

Tag

Cards List
#diffusion-transformer

Bringing Your Muse to Life (5 minute read)

TLDR AI ↗ · 23h ago Cached

Meta AI introduces Muse Realtime Avatar, a state-of-the-art embodiment technology that turns voice into synchronized, expressive avatars in real time using a streaming Diffusion Transformer.

0 favorites 0 likes
#diffusion-transformer

Mira-Scene: Pixel-Aligned Layouts for Generative 3D Scene

Hugging Face Daily Papers ↗ · 5d ago Cached

Mira-Scene introduces a compositional 3D scene reconstruction framework using pixel-aligned canonical coordinate maps for accurate object layouts, achieving significant improvements in layout accuracy over existing methods.

0 favorites 0 likes
#diffusion-transformer

@ModelScope2022: Marigold V2 turns an image-editing DiT into a single-step model for sharp, detailed dense prediction. Apache 2.0. https…

X AI KOLs Timeline ↗ · 2026-09-14 Cached

Marigold V2 transforms an image-editing Diffusion Transformer into a single-step model for sharp dense prediction, achieving best zero-shot results in depth estimation and related tasks with Apache 2.0 license.

0 favorites 0 likes
#diffusion-transformer

LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows

Hugging Face Daily Papers ↗ · 2026-09-14 Cached

LynnReal-Omni is a unified multimodal video diffusion framework that integrates agentic visual controls with high-fidelity generation and real-time acceleration for stable, controllable video creation.

0 favorites 0 likes
#diffusion-transformer

Training a 210M text-to-image DiT from scratch on one GPU: what I measured [P]

Reddit r/MachineLearning ↗ · 2026-09-11

A detailed write-up on training a 210M text-to-image diffusion transformer from scratch on a single GPU, sharing key measurements on attention sinks, loss as a health signal, and timestep shifting benefits.

0 favorites 0 likes
#diffusion-transformer

StepAudio 3 Music Technical Report

Hugging Face Daily Papers ↗ · 2026-09-11 Cached

StepAudio 3 Music introduces a large-scale, long-form music generation model with explicit musical planning via ABC-CoT, achieving high scores in audio quality and similarity metrics compared to other systems.

0 favorites 0 likes
#diffusion-transformer

UniMate: One Unified Model to Animate Diverse Skeletons

Hugging Face Daily Papers ↗ · 2026-09-04 Cached

UniMate is a unified diffusion transformer model that generates articulated motion for diverse skeletons from text and rigged 3D assets without per-skeleton retraining, using topology-aware attention and a large curated dataset.

0 favorites 0 likes
#diffusion-transformer

OutageDiT: A Generative Foundation Model for Power Outage Forecasting and Scenario Simulation

arXiv cs.LG ↗ · 2026-09-03 Cached

OutageDiT is a generative foundation model for power outage forecasting that uses a Diffusion Transformer architecture to generate seven-day outage trajectories, improving forecast accuracy and enabling zero-shot transfer to new regions.

0 favorites 0 likes
#diffusion-transformer

LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes

Hugging Face Daily Papers ↗ · 2026-09-03 Cached

LLaDA-Image presents a unified framework that combines a 6B diffusion transformer with a frozen vision-language module for generating photorealistic images with precise editing, achieving state-of-the-art results among open-source models through efficient training and fast inference.

0 favorites 0 likes
#diffusion-transformer

Atlas: A World Model for Spatial Intelligence

Hacker News Top ↗ · 2026-09-01 Cached

World Labs introduces Atlas, a multimodal world model that can generate, reconstruct, and simulate 3D environments with camera control and spatial consistency.

0 favorites 0 likes
#diffusion-transformer

Wan-Animate-2: Pushing the Application Boundaries of Character Animation Models

Reddit r/LocalLLaMA ↗ · 2026-08-07

Wan-Animate-2 is a new end-to-end character animation framework that consumes driving videos directly in a redesigned Diffusion Transformer, achieving high-fidelity motion generation and identity preservation. It also introduces a lightweight variant for real-time streaming animation, with open-source weights released.

0 favorites 0 likes
#diffusion-transformer

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

Hugging Face Daily Papers ↗ · 2026-08-07 Cached

AtlasVLA introduces a dual-memory architecture with persistent world-ego state modeling to overcome perception and task-progress forgetting in vision-language-action models, achieving state-of-the-art long-horizon manipulation from a single wrist camera.

0 favorites 0 likes
#diffusion-transformer

EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

Hugging Face Daily Papers ↗ · 2026-08-06 Cached

EffectLearner is a semantic-reasoning-enhanced framework for real-world video object removal, combining a VLM-based Object-Effect Reasoner with a DiT-based Video Eraser and introducing the EffectWorld dataset to handle complex object-induced effects.

0 favorites 0 likes
#diffusion-transformer

Xiaomi-Robotics-1: New robotics model released

Reddit r/LocalLLaMA ↗ · 2026-08-05

Xiaomi released XR-1, a robot foundation model trained on over 100K hours of real-world manipulation trajectories. Built on Qwen3-VL and a Diffusion Transformer, it enables out-of-the-box mobile manipulation in unseen environments.

0 favorites 0 likes
#diffusion-transformer

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-Design

Hacker News Top ↗ · 2026-07-29 Cached

Transformer Transformer is a unified model that generates complete robot embodiments optimized for a given manipulation demonstration, using a diffusion transformer trained on RoboTokens and Dynamics Self-Guidance.

0 favorites 0 likes
#diffusion-transformer

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

Hugging Face Daily Papers ↗ · 2026-07-27 Cached

WorldDiT is a unified diffusion transformer architecture that couples action generation with visual world modeling, achieving strong performance on LIBERO simulation suites without relying on large pretrained vision-language models.

0 favorites 0 likes
#diffusion-transformer

Nvidia's New Long-Form Video Generation (12 minute read)

TLDR AI ↗ · 2026-07-27 Cached

NVIDIA Research introduces SANA-Video 2.0, a hybrid video diffusion transformer that generates high-quality 720p video on a single GPU, achieving up to 120× speedup over Wan 2.2-14B via hybrid linear-softmax attention and block attention residuals.

0 favorites 0 likes
#diffusion-transformer

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

Hugging Face Daily Papers ↗ · 2026-07-23 Cached

SANA-Video 2.0 introduces a hybrid linear-softmax attention mechanism for video diffusion transformers, achieving high-quality video generation up to 720p on a single GPU with significantly reduced latency compared to full-softmax models, while maintaining competitive VBench scores.

0 favorites 0 likes
#diffusion-transformer

microsoft/Mage-Flow-Edit-Turbo

Hugging Face Models Trending ↗ · 2026-07-21 Cached

Microsoft releases Mage-Flow-Edit-Turbo, a compact 4B-scale generative model for efficient text-to-image generation and instruction-based image editing, achieving state-of-the-art competitive quality through co-designed tokenizer and backbone.

0 favorites 0 likes
#diffusion-transformer

microsoft/Mage-Flow

Hugging Face Models Trending ↗ · 2026-07-21 Cached

Microsoft releases Mage-Flow, a compact 4B-parameter foundation model for efficient native-resolution text-to-image generation and instruction-based image editing, achieving competitive quality against much larger models.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback