TenStrip/10Eros-Max

Hugging Face Models Trending 模型

摘要

TenStrip/10Eros-Max是一个实验性AI模型,通过正交投影从LTX 2.3、Wan 2.2和Krea 2视频与图像扩散模型中迁移学习模式,以修改MiniMax H3基础模型,增强美学与运动特性,同时保留核心视频和音频功能。

任务: 图像文本到视频 标签: 文本到视频, 图像文本到视频, 图像到视频, base_model:MiniMaxAI/MiniMax-H3, base_model:finetune:MiniMaxAI/MiniMax-H3, license:other, region:us
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:40

TenStrip/10Eros-Max · Hugging Face

来源:https://huggingface.co/TenStrip/10Eros-Max

目前,本版本是在MiniMax H3基础模型上进行的实验,它融合了来自另外两个视频扩散模型(LTX 2.3 和 Wan 2.2)的学习模式,并在test3及后续版本中,引入了一个图像扩散模型(Krea 2)的模式到H3的Transformer架构中。

这是一个统一的Transformer,具有针对不同模态(视频、音频、条件)的输入投影器,输入到一个52层的Transformer堆栈(2层用于文本条件的token_refiner加上50个主模块),并具有针对不同模态的输出头。Transformer堆栈全程使用相同的模块架构,这使得注意力和MLP层成为适合在不同模型间进行特性迁移的架构位置——模态路由位于流程的边缘,而非Transformer内部。

首先对H3的前端模块应用了LTX的迁移,随后是Wan的迁移,针对H3的中后部模块。每次迁移都直接修改了注意力权重;第二次迁移还修改了更宽泛模块范围内的前馈层。这两次视频源迁移共同表明,完全不同的视频模型架构都可以将其自身可辨识的特性贡献给H3。

第三次迁移引入了Krea 2——一个图像扩散模型,而非视频模型。这是一个更具探索性的方向,因为图像模型学习的是单帧内的空间关系,而视频模型学习的是跨多帧的时空关系。Krea的贡献范围严格限定在其注意力结构中承载空间学习的部分:查询投影(编码要关注哪些视觉特征),以及在少量位置上的配对键值投影(编码这些特征如何关联)。前馈层也部分进行了迁移,但仅限于Krea门控MLP的输入侧——跳过了输出投影,因为Krea的组合逻辑是为图像模型的输出路径训练的,与H3的视频处理不匹配。这种更窄的范围让Krea能够贡献更精细的视觉特性和细节处理,而不干扰H3的时间连贯性。

MiniMax自身的架构文档指出,H3的注意力和前馈层不包含特定模态的结构——模型中处理“这是音频还是视频还是文本”的部分位于模型其他地方。这意味着注意力和前馈权重是从其他训练模型迁移特性而不干扰H3处理各模态方式的、架构上合适的位置。这同样适用于同领域的视频源和跨领域的图像源,尽管跨领域迁移需要更仔细的范围界定,因为并非图像模型学到的每个模式都能在视频模型中找到连贯的归宿。

这些修改使用了正交投影数学——新的权重模式主要在基础模型未使用的方向上添加到H3中。这使得迁移的特性能够补充H3而非覆盖它。对于跨领域的Krea迁移,这一点尤其重要:Krea的模式和H3的模式在权重空间中几乎是垂直的,这为正交投影提供了最大的操作空间,同时几乎完全保留了H3自身的方向。

结合对受影响模块的精确控制——特别是对于Krea,精确控制哪些注意力头位置接收注入,以避免干扰最常用于音频处理的头槽位——这保留了H3生成带音频的连贯视频的核心能力,同时将其美学和运动特性向源模型偏移。模型的实际模块权重、安全功能和防护栏在架构意义上保持未修改——所有修改都是对现有权重的受控加法扰动,而非替换模型自身的结构。

在最终的beta1配置中,H3模型接受了来自其他捐赠者的针对性“移植”,目标是token_refiner模块0和1——这个两层文本精炼堆栈在Gemma文本嵌入进入主模块生成之前对其进行处理。因为token精炼决定了主模块接收到的文本条件,所以这里的修改会影响整个提示方向和输出结构。

H3模型的融合Q/K/V投影被解融合为单独的q_proj、k_proj、v_proj张量——这是必要的,因为融合格式不允许逐带手术,但确实需要为ComfyUI推理重新融合回融合的qkv_proj格式。

attn_q被分配给Krea,以将token精炼的“关注什么”方向转向Krea学习到的模式,从而在token层面改变风格。

attn_k被隔离。这对任何训练或合并到H3的人来说都是值得指出的实证发现:attn_k似乎承载着模型放大行为的关键校准。即使是轻微的扰动也会降低音频质量以及模型强化学习带来的其他精细训练细节。由于H3没有显式控制门(不像LTX使用to_gate_logits),它似乎依赖于精确调校的attn_k来调节注意力强度。标准训练流程在不知道这一点的情况下触及K,可能正在悄然损害模型。隔离K需要解融合qkv三元组,仅针对Q和V进行操作,然后重新融合——beta1工具链支持此操作。

attn_v通过线性-幅度模式移植分配给LTX-2.3(Eros谱系)。V承载了输出特性的主要部分,因此这是LTX Eros内容流入H3文本精炼的通道。

三元组被重新融合回融合的qkv_proj格式,然后将Wan 2.2的主模块MLP fc1作为补充贡献移植到模块0和1——Wan 2.2的维度与H3的token_refiner MLP内部维度几乎完美对齐(96%覆盖),使其在结构上非常适合。

这些移植共同注入了一种显著但微妙的影响:它们带来了特定的运动细节,调整了文生视频风格,并且没有像许多训练和合并方法那样,从基础模型中移除提示或行为能力。虽然存在一些音频质量下降,但程度有限。考虑到H3统一的音视频注意力架构,有意义的视频路径修改很难与音频影响分离开——这种统一性在合并/移植层面确实难以规避。

适用标准的H3社区许可证。由于本版本现在包含了来自LTX 2.3、Wan 2.2和Krea 2的迁移特性,因此这些源模型的社区许可证也适用于来自它们各自部分的特性。

相似文章

TenStrip/LTX2.3-10Eros

Hugging Face Models Trending

本文介绍了 TenStrip/LTX2.3-10Eros,这是一款托管在 Hugging Face 上的微调 AI 视频模型,旨在提升图像到视频生成的效果及对提示词的遵循度。文章提供了有关文件格式、与 ComfyUI 节点的兼容性以及实现最佳效果的特定提示词策略等技术细节。

MiniMax H3(10分钟阅读)

TLDR AI

MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。

MiniMaxAI/MiniMax-M2.7

Hugging Face Models Trending

MiniMaxAI发布了MiniMax-M2.7,这是一个开放权重模型,具备自我进化能力、先进的智能体团队支持,并在软件工程基准测试中表现出色(SWE-Pro上56.22%,MLE Bench Lite上66.6%奖牌率),在生产事故恢复和专业工作任务中有显著应用。

MiniMaxAI/MiniMax-M3

Hugging Face Models Trending

MiniMax 发布 M3,一款原生多模态模型,拥有100万上下文和约4280亿参数,采用 MiniMax Sparse Attention (MSA) 实现高效长上下文处理,达到前沿级别的编码和智能体性能。