video-generation

标签

Cards List
#video-generation

CaM-Wolf:用于社交推理游戏的多模态因果感知智能体

arXiv cs.AI · 2026-07-31 缓存

CaM-Wolf是首个面向狼人杀等社交推理游戏的多模态AI智能体,集成了视频感知与生成,并通过强化学习训练的因果感知推理器来处理隐藏角色和社交推理任务。实验和用户研究显示,它在游戏表现和人机交互质量上均有显著提升。

0 人收藏 0 人点赞
#video-generation

@VoidAsuka:很长一段时间没有好的开源视频生成模型了,所以我们做了一个。这是一个SOTA视频生成模型…

X AI KOLs Following · 2026-07-31 缓存

宣布推出开源SOTA视频生成模型MiniMax H3,具备商业级生成能力、无与伦比的成本效益以及开放权重。

0 人收藏 0 人点赞
#video-generation

MiniMax H3(10分钟阅读)

TLDR AI · 2026-07-31 缓存

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

0 人收藏 0 人点赞
#video-generation

Comfy-Org/MiniMax-H3

Hugging Face Models Trending · 2026-07-30 缓存

Comfy-Org 为 ComfyUI 重新打包了 MiniMax-H3 模型文件,包括扩散模型、文本编码器和 VAE,并提供了用于文本生成视频、图像生成视频和参考生成视频的工作流模板。

0 人收藏 0 人点赞
#video-generation

ODEWorld:通过物理时间流的连续预测架构

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了 ODEWorld,一种使用物理时间流(PT-Flow)的连续时间潜在世界模型,该模型学习由常微分方程参数化的潜在速度场,能够实现任意时间分辨率、回溯预测,并改进视频生成和机器人控制的规划。

0 人收藏 0 人点赞
#video-generation

PhiZero:一个围绕物理语言构建的世界模型

Hugging Face Daily Papers · 2026-07-30 缓存

PhiZero是一个物理世界模型,它从视频中学习一种称为“物理语言”的紧凑离散表示,并在渲染未来视频之前用它来推理世界状态的转换,从而在生成和理解任务中提高物理一致性。

0 人收藏 0 人点赞
#video-generation

视频生成的并行解码(10分钟阅读)

TLDR AI · 2026-07-30 缓存

NVIDIA推出并行解码蒸馏(PDD)技术,用于加速图像和视频生成,能够以更少的神经函数评估在LTX-2.3和Wan2.1-14B等模型上实现高质量输出。

0 人收藏 0 人点赞
#video-generation

LeapTalk: 打破说话头生成中的延迟-质量权衡

Hugging Face Daily Papers · 2026-07-29 缓存

LeapTalk 提出了一种新颖的框架,通过单步桥接蒸馏克服了说话头生成中的延迟-质量权衡,实现了高达 200 FPS 的稳定实时生成,并减少了身份漂移。

0 人收藏 0 人点赞
#video-generation

VideoCoCo:通过代理双引擎系统实现物理一致视频生成的代码即思维链框架

Hugging Face Daily Papers · 2026-07-29 缓存

介绍了VideoCoCo,一种代理双引擎框架,使用可执行的Blender代码作为思维链中间表示,用于物理一致的视频生成,在PhyGenBench和VBench-2.0上取得了最先进的分数。

0 人收藏 0 人点赞
#video-generation

StatePlay:状态感知游戏世界模型,用于机制一致生成

Hugging Face Daily Papers · 2026-07-29 缓存

StatePlay 提出了一种状态感知游戏世界模型,该模型联合预测视觉内容和游戏状态,以生成机制一致的游戏推演,在机制保真度上提升了18.6%。

0 人收藏 0 人点赞
#video-generation

@LinusEkenstam: 我用10秒视频制作了自己的数字分身。在片段中:左边是我本人,中间是领先的虚拟形象……

X AI KOLs Following · 2026-07-28 缓存

Mirage Avatar X by Captions 仅用10秒视频就能创建逼真的数字分身,保留身份特征、表情和举止,且无质量衰减。

0 人收藏 0 人点赞
#video-generation

@alex_prompter: 如果你制作AI视频,你就知道这个循环。写提示词、生成、重试,直到你的额度用完。@Topv…

X AI KOLs Timeline · 2026-07-28 缓存

TopviewAI 的 Film Studio 为 AI 视频生成提供了六种控制,包括表演指导、镜头控制和 3D 场景布局,让电影制作人能够执导镜头,而不仅仅是提示片段。

0 人收藏 0 人点赞
#video-generation

并行解码蒸馏加速图像与视频生成

Hugging Face Daily Papers · 2026-07-28 缓存

并行解码蒸馏(PDD)是一种基于轨迹的蒸馏方法,通过每次网络评估预测多个去噪步骤来加速图像与视频生成,在 LTX-2.3、Wan14B 和 Qwen-Image 等模型上仅需 4-8 次函数评估即可达到最优性能。

0 人收藏 0 人点赞
#video-generation

Sol-Attn: 通过即时注意力稀疏化加速视频生成推理

Hugging Face Daily Papers · 2026-07-27 缓存

Sol-Attn 提出了一种无需训练的方法,用于视频生成推理的注意力稀疏化,通过在线softmax过程中动态选择键值块,实现了超过2倍的速度提升,且质量损失极小。

0 人收藏 0 人点赞
#video-generation

FilmBench:一个电影级视频生成基准

Hugging Face Daily Papers · 2026-07-27 缓存

FilmBench是一个面向电影级视频生成的新基准,其提示源自跨越20种类型的获奖影片,并采用包含35+子指标的三级电影级分类体系。它包含一个开源自动化评估代理(FilmOps),该代理以高相关性复现人工模型排名,揭示了动态美学和多镜头表现方面的显著差距,相较于以往的网页风格基准。

0 人收藏 0 人点赞
#video-generation

Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI · 2026-07-27 缓存

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

0 人收藏 0 人点赞
#video-generation

@seekjourney: 后悔知道晚了,通过我的 github 雷达发现一个宝藏仓库:video-shotcraft 106 个镜头配方、162 种风格、161 个动态预览,还把分镜、运镜、节奏、音效和 Remotion 实现都整理成了 Agent Skill。 …

X AI KOLs Timeline · 2026-07-24 缓存

A GitHub repository video-shotcraft provides 106 shot recipes, 162 styles, and 161 dynamic previews organized as Agent Skills for AI video generation using Remotion and compatible with Claude Code and Codex.

0 人收藏 0 人点赞
#video-generation

@DanKornas: 当推理、模型配置和集成路径集中在一处时,构建视频生成工作流程会更加容易。L…

X AI KOLs Timeline · 2026-07-24 缓存

LTX-Video 是 Lightricks 开发的一个开源 Python 仓库,用于在本地使用 LTX-Video 模型生成和调节视频,支持文本/图像输入、多条件工作流程,并与 ComfyUI 和 Diffusers 集成。

0 人收藏 0 人点赞
#video-generation

@DanKornas: 当每个模型和参数都藏在不同的脚本后面时,视觉AI工作流变得难以管理。ComfyUI是一个……

X AI KOLs Timeline · 2026-07-23 缓存

ComfyUI是一款开源的、基于节点的AI创作引擎,让构建者和视觉专业人士无需编码即可设计复杂的生成工作流,支持图像、视频、音频和3D,具备部分重新执行能力和广泛的模型支持。

0 人收藏 0 人点赞
#video-generation

Black Forest Lab's Flux 3: 全模态用于图像、视频、音频和动作预测

Reddit r/singularity · 2026-07-23

Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈