在TensorSharp中成功运行MiniMax H3视频生成

Reddit r/LocalLLaMA 工具

摘要

一位开发者已将MiniMax H3视频生成集成到TensorSharp中,这是一个本地推理引擎,支持图像到视频生成,并突出了LLM、多模态和视频推理在单一运行时中的融合。

我一直在尝试MiniMax H3,现在终于在TensorSharp中实现了视频生成。TensorSharp最初主要是一个本地GGUF/LLM推理引擎,因此在同一个运行时中让视频生成流水线工作是一个有趣的方向转变。附带的演示是图像到视频:提供一个图像作为上下文,然后是一个描述运动/场景的提示,H3通过TensorSharp在本地生成结果视频。最让我感兴趣的不是用户界面——而是LLM、多模态、图像,以及现在的视频推理融合到同一个本地推理引擎中,而不是每个模型家族都需要一个完全独立的Python栈。还有很多需要优化的地方。与自回归LLM相比,视频模型对内存管理、张量调度、注意力机制和模型卸载施加了非常不同的压力。我好奇大家接下来会优先考虑H3推理的哪些方面:降低显存占用、更快的生成速度、更好的量化模型支持、多GPU支持、更长的生成长度、参考/视频到视频工作流。如果有人想查看实现,请参考代码仓库:https://github.com/zhongkaifu/TensorSharp
查看原文

相似文章

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

加速MiniMax-H3(阅读时间12分钟)

TLDR AI

本文基准测试了MiniMax-H3视频生成在8×H200 GPU上使用SGLang Diffusion的加速效果,通过SSIM衡量质量,最高实现6.24倍速度提升。

介绍 fal 推出的 H3 Max(5分钟阅读)

TLDR AI

H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。