标签
ZeroModels是一个工具,能够使用Keras 3在多个后端(JAX、PyTorch、TensorFlow)上运行任何AI模型,权重从原始检查点转换而来,且运行时无需依赖transformers或torch。
一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。
本文研究了同一系列(Pythia)中不同规模Transformer模型之间迁移的内容,表明表示对齐而权重不对齐,并且通过初始化而非直接权重投影进行转换效果最佳。
本文提出功能重构方法,将MHA/GQA检查点转换为投机解码的MLA草稿模型,直接优化注意力模块以保留令牌接受率。报告在涉及Llama/Qwen模型和多种转换方法的192种配置中持续改进。
将 Qwen 3.6 35b a3b 模型转换为 ROCmfp4 格式,利用 MTP 优势提升 AMD 硬件上的性能。
作者提供了仅包含Qwen3.6模型MTP张量的提取GGUF文件,用户可通过显著小于完整模型文件的下载大小来嫁接张量。