diffusion-transformer

标签

Cards List
#diffusion-transformer

将您的 Muse 带入生活(5分钟阅读)

TLDR AI ↗ · 昨天 缓存

Meta AI 推出了 Muse Realtime Avatar,这是一项尖端的化身技术,使用流式 Diffusion Transformer 实时将语音转化为同步、富有表现力的化身。

0 人收藏 0 人点赞
#diffusion-transformer

Mira-Scene:用于生成式三维场景的像素对齐布局

Hugging Face Daily Papers ↗ · 6天前 缓存

Mira-Scene 引入了一个组合式三维场景重建框架,使用像素对齐的规范坐标图进行精确的对象布局,在布局精度上相较于现有方法实现了显著提升。

0 人收藏 0 人点赞
#diffusion-transformer

Marigold V2 将图像编辑 DiT 转换为单步模型,用于生成清晰、详细的密集预测。Apache 2.0。https…

X AI KOLs Timeline ↗ · 2026-09-14 缓存

Marigold V2 将图像编辑 DiT 转换为单步模型,用于清晰密集预测,在深度估计及相关任务中实现了最佳零样本结果,采用 Apache 2.0 许可证。

0 人收藏 0 人点赞
#diffusion-transformer

LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

LynnReal-Omni 是一个统一的多模态视频扩散框架,它将智能体视觉控制与高保真生成和实时加速相结合,以实现稳定、可控的视频创作。

0 人收藏 0 人点赞
#diffusion-transformer

从头开始在单个GPU上训练一个210M文本到图像DiT:我的测量结果 [P]

Reddit r/MachineLearning ↗ · 2026-09-11

一篇详细的文章,介绍了从头开始在单个GPU上训练一个210M文本到图像扩散Transformer,分享了关于注意力汇聚、损失作为健康信号以及时间步偏移益处的关键测量结果。

0 人收藏 0 人点赞
#diffusion-transformer

StepAudio 3 Music 技术报告

Hugging Face Daily Papers ↗ · 2026-09-11 缓存

StepAudio 3 Music 介绍了一个大规模、长篇音乐生成模型,通过 ABC-CoT 实现显式音乐规划,在音频质量和相似度指标上取得了高分,与其他系统相比表现优异。

0 人收藏 0 人点赞
#diffusion-transformer

UniMate:一个统一模型,用于动画化多样骨架

Hugging Face Daily Papers ↗ · 2026-09-04 缓存

UniMate是一个统一的扩散变换器模型,能够从文本和绑定了3D资产为多样骨架生成关节运动,无需针对每个骨架进行重新训练。它利用拓扑感知注意力和一个大型精选数据集。

0 人收藏 0 人点赞
#diffusion-transformer

OutageDiT:一种用于停电预测和场景模拟的生成式基础模型

arXiv cs.LG ↗ · 2026-09-03 缓存

OutageDiT是一种用于停电预测的生成式基础模型,它采用Diffusion Transformer架构生成七天停电轨迹,提高预测准确度并实现向新区域的零样本迁移。

0 人收藏 0 人点赞
#diffusion-transformer

LLaDA-Image: 构建强大图像生成器的完全开放训练方案

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。

0 人收藏 0 人点赞
#diffusion-transformer

Atlas:用于空间智能的世界模型

Hacker News Top ↗ · 2026-09-01 缓存

World Labs 推出 Atlas,一个能够生成、重建和模拟三维环境的多模态世界模型,并支持相机控制和空间一致性。

0 人收藏 0 人点赞
#diffusion-transformer

Wan-Animate-2:拓展角色动画模型的应用边界

Reddit r/LocalLLaMA ↗ · 2026-08-07

Wan-Animate-2 是一个全新的端到端角色动画框架,它在重新设计的 Diffusion Transformer 中直接输入驱动视频,实现高保真动作生成和身份保持。它还推出了一个轻量级变体,用于实时流式动画,并已发布开源权重。

0 人收藏 0 人点赞
#diffusion-transformer

AtlasVLA:视觉-语言-动作模型的持久世界-自我状态建模

Hugging Face Daily Papers ↗ · 2026-08-07 缓存

AtlasVLA 引入了具有持久世界-自我状态建模的双记忆架构,以克服视觉-语言-动作模型中的感知遗忘和任务进度遗忘问题,仅通过单个腕部相机即可实现最先进的长时程操作。

0 人收藏 0 人点赞
#diffusion-transformer

EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

EffectLearner 是一个面向真实世界视频物体移除的语义推理增强框架,它将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合,并引入了 EffectWorld 数据集以处理复杂的物体引发效果。

0 人收藏 0 人点赞
#diffusion-transformer

Xiaomi-Robotics-1:新一代机器人模型发布

Reddit r/LocalLLaMA ↗ · 2026-08-05

小米发布了 XR-1,这是一个机器人基础模型,基于超过 10 万小时的真实世界操作轨迹进行训练。它基于 Qwen3-VL 和 Diffusion Transformer 构建,能够在未见过的环境中实现开箱即用的移动操作。

0 人收藏 0 人点赞
#diffusion-transformer

Transformer Transformer: 面向运动条件机器人协同设计的统一模型

Hacker News Top ↗ · 2026-07-29 缓存

Transformer Transformer是一种统一模型,能够根据给定的操作演示生成优化的完整机器人本体,该模型使用在RoboTokens和Dynamics Self-Guidance上训练的扩散变换器。

0 人收藏 0 人点赞
#diffusion-transformer

WorldDiT:统一的世界与动作建模扩散架构

Hugging Face Daily Papers ↗ · 2026-07-27 缓存

WorldDiT是一种统一的扩散变换器架构,它将动作生成与视觉世界建模相结合,在LIBERO仿真套件上取得了强劲性能,且无需依赖大型预训练视觉语言模型。

0 人收藏 0 人点赞
#diffusion-transformer

Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI ↗ · 2026-07-27 缓存

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

0 人收藏 0 人点赞
#diffusion-transformer

SANA-Video 2.0:基于混合线性注意力和注意力残差的高效视频生成

Hugging Face Daily Papers ↗ · 2026-07-23 缓存

SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。

0 人收藏 0 人点赞
#diffusion-transformer

microsoft/Mage-Flow-Edit-Turbo

Hugging Face Models Trending ↗ · 2026-07-21 缓存

微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。

0 人收藏 0 人点赞
#diffusion-transformer

microsoft/Mage-Flow

Hugging Face Models Trending ↗ · 2026-07-21 缓存

Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈