diffusion-transformer

标签

Cards List
#diffusion-transformer

Wan-Animate-2:拓展角色动画模型的应用边界

Reddit r/LocalLLaMA · 3天前

Wan-Animate-2 是一个全新的端到端角色动画框架,它在重新设计的 Diffusion Transformer 中直接输入驱动视频,实现高保真动作生成和身份保持。它还推出了一个轻量级变体,用于实时流式动画,并已发布开源权重。

0 人收藏 0 人点赞
#diffusion-transformer

EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理

Hugging Face Daily Papers · 5天前 缓存

EffectLearner 是一个面向真实世界视频物体移除的语义推理增强框架,它将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合,并引入了 EffectWorld 数据集以处理复杂的物体引发效果。

0 人收藏 0 人点赞
#diffusion-transformer

Xiaomi-Robotics-1:新一代机器人模型发布

Reddit r/LocalLLaMA · 5天前

小米发布了 XR-1,这是一个机器人基础模型,基于超过 10 万小时的真实世界操作轨迹进行训练。它基于 Qwen3-VL 和 Diffusion Transformer 构建,能够在未见过的环境中实现开箱即用的移动操作。

0 人收藏 0 人点赞
#diffusion-transformer

Transformer Transformer: 面向运动条件机器人协同设计的统一模型

Hacker News Top · 2026-07-29 缓存

Transformer Transformer是一种统一模型,能够根据给定的操作演示生成优化的完整机器人本体,该模型使用在RoboTokens和Dynamics Self-Guidance上训练的扩散变换器。

0 人收藏 0 人点赞
#diffusion-transformer

WorldDiT:统一的世界与动作建模扩散架构

Hugging Face Daily Papers · 2026-07-27 缓存

WorldDiT是一种统一的扩散变换器架构,它将动作生成与视觉世界建模相结合,在LIBERO仿真套件上取得了强劲性能,且无需依赖大型预训练视觉语言模型。

0 人收藏 0 人点赞
#diffusion-transformer

Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI · 2026-07-27 缓存

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

0 人收藏 0 人点赞
#diffusion-transformer

SANA-Video 2.0:基于混合线性注意力和注意力残差的高效视频生成

Hugging Face Daily Papers · 2026-07-23 缓存

SANA-Video 2.0 为视频扩散Transformer引入了混合线性-softmax注意力机制,可在单个GPU上生成高达720p的高质量视频,与全softmax模型相比显著降低延迟,同时保持具有竞争力的VBench分数。

0 人收藏 0 人点赞
#diffusion-transformer

microsoft/Mage-Flow-Edit-Turbo

Hugging Face Models Trending · 2026-07-21 缓存

微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。

0 人收藏 0 人点赞
#diffusion-transformer

microsoft/Mage-Flow

Hugging Face Models Trending · 2026-07-21 缓存

Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。

0 人收藏 0 人点赞
#diffusion-transformer

Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑

Hugging Face Daily Papers · 2026-07-21 缓存

Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。

0 人收藏 0 人点赞
#diffusion-transformer

MGDT:MLLM引导的扩散Transformer结合关系自适应混合专家模型用于多模态知识图谱补全

arXiv cs.AI · 2026-07-20 缓存

提出了M2GDT,一种新颖的MKGC框架,它利用MLLM引导的扩散Transformer与关系自适应混合专家模型来对齐和去噪多模态特征,在三个基准数据集上优于基线方法。

0 人收藏 0 人点赞
#diffusion-transformer

VideoRAE:通过表示自编码器驯服视频基础模型进行生成建模

Hugging Face Daily Papers · 2026-07-15 缓存

本文介绍了VideoRAE,一种表示自编码器,它利用冻结的视频基础模型来创建紧凑、可重建且利于生成的视频潜在表示。该模型在UCF-101上取得了最先进的结果,且收敛速度优于其他自编码器。

0 人收藏 0 人点赞
#diffusion-transformer

FreyaTTS 技术报告

arXiv cs.CL · 2026-07-13 缓存

FreyaTTS 是一款紧凑型、无需分词器的土耳其语优先文本转语音模型,基于非自回归条件流匹配扩散变换器,以远小于大型系统的参数量实现了最先进的性能,并基于 Apache-2.0 许可发布。

0 人收藏 0 人点赞
#diffusion-transformer

RynnWorld-Teleop:一种用于数字遥操作的动作条件世界模型

Hugging Face Daily Papers · 2026-07-07 缓存

介绍使用动作条件世界模型进行数字遥操作,为机器人技术生成多样化训练数据,将数据收集与物理硬件解耦。该系统实现实时生成,并支持零样本Sim2Real迁移。

0 人收藏 0 人点赞
#diffusion-transformer

PointDiT: 像素空间扩散用于单目几何估计

Hugging Face Daily Papers · 2026-07-02 缓存

PointDiT提出了一种极简的像素空间扩散变换器,使用纯ViT架构进行单目几何估计,在超越复杂基于潜空间模型的同时,在模糊区域保持简洁性和鲁棒性。

0 人收藏 0 人点赞
#diffusion-transformer

行走于隐空间:基于神经场景表示的交互式世界探索

Hugging Face Daily Papers · 2026-06-29 缓存

NeuWorld 是一个新的交互式视频生成系统,它利用紧凑的神经隐式场景表示以及结合扩散变换器的变换器VAE,实现轨迹条件渲染,达到长时一致性。

0 人收藏 0 人点赞
#diffusion-transformer

MirrorPPR:基于示例的人像照片修图

Hugging Face Daily Papers · 2026-06-28 缓存

MirrorPPR 提出了一种基于示例的人像修图框架,采用带有 LoRA 适应的扩散变换器和自增强训练数据,实现了卓越的质量和身份保持。

0 人收藏 0 人点赞
#diffusion-transformer

EO-WM:一种物理信息驱动的概率地球观测预测世界模型

Hugging Face Daily Papers · 2026-06-25 缓存

EO-WM提出了一种视频扩散变换器,用于概率性地球观测预测,该模型融入了物理信息条件,以捕捉天气驱动的不确定性,从而在极端天气下实现了对植被指数的更好预测。

0 人收藏 0 人点赞
#diffusion-transformer

@rohanpaul_ai: AI视频正进入实时互动时代,MaineCoon如今在低延迟AI视频领域领先。@catnips_ai刚刚…

X AI KOLs Following · 2026-06-23 缓存

MaineCoon是一款22B参数的实时文生音频视频模型,在单张H100 GPU上可达47.5 FPS,支持低成本、长时长的流式生成,同步语音与画面,用于实时AI角色。

0 人收藏 0 人点赞
#diffusion-transformer

MeshFlow: 基于等变流匹配的网格生成

Hugging Face Daily Papers · 2026-06-22 缓存

MeshFlow 引入了一种等变最优传输流匹配模型,用于直接生成三角形网格,在达到最先进质量的同时,相比自回归方法提供了约18倍的推理加速。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈