新的 Muse-Glimmer-30B SoTA 量化版本——希望是新的阵容 :)
摘要
作者发布了 Muse-Glimmer-30B 模型的新 SoTA 量化版本,声称它们通过新颖的技术在各类 VRAM 中优于现有量化版本,其中包括一个更小且更接近 BF16 的 Q8 量化版本。他们在 HuggingFace 上分享了方法论,并讨论了未来的文章。
大家好,我做量化版本已经有段时间了——最近我短暂休息了一下,投入到硬核研究中(期间提交了我的第一篇 EMNLP 论文!)。在这个过程中,我积累了一些量化优化技巧:从新颖的、待发表论文的技巧,到一些真正厉害的张量映射算法。我把一些秘密配方用在了新发布的 Muse Glimmer 30B 上(META IS BACK!),并和几个 OG 模型进行了对比。说实话,我很震惊它在每一档 VRAM 级别上都不会输给任何现有量化版本!其中最酷的一个是我的 Q8 量化版本,它比 UD-Q8_K_XL 更小,并且接近 BF16 的程度提高了 21%。完整方法论在模型卡片上——评估设置、置信区间、保留切片等等。欢迎在评论区提问。模型:https://huggingface.co/AaryanK/Muse-Glimmer-30B-GGUF 我原本还有优化空间,但计算额度用完了 :( 作为一个独自搞研究的本科大二学生,我不能经常花 H100 的钱,这就是标题里“希望是”的原因 :) 我正在寻找 AI 代理编排和模型推理方面的实习机会。如果这项工作与你的团队相关:linkedin.com/in/theaaryankapoor 我计划很快写一篇详细介绍其中一些秘密配方的文章!
https://preview.redd.it/yzf6n2fyuuih1.png?width=1860&format=png&auto=webp&s=aa8b615918c447001f816f891e7f52d758c72548
https://preview.redd.it/tgkxp30wuuih1.png?width=1920&format=png&auto=webp&s=366cf095528f9c2cd8ca7aa3e8d49a946085b374
https://preview.redd.it/0rcl5o70vuih1.png?width=1980&format=png&auto=webp&s=e1fddd2f83e395198fb75e37145d7eaadd72a916
祝大家推理更上一层楼!
相似文章
@TheAhmadOsman: Qwen 3.8 27B 能否在与 Muse Glimmer 30B 的对抗中卷土重来?无论如何,对这次发布感到非常高兴
一位用户对新的AI模型发布表示兴奋,并推测 Qwen 3.8 27B 能否与 Muse Glimmer 30B 竞争。
Muse Glimmer 居然真的能装进单张 RTX 3090
用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。
Muse Glimmer 是一个伪装成 30B Transformer 的内存层次结构
Meta 的 Muse Glimmer 是一款为消费级硬件上的自主代理任务设计的 30B 多模态 Transformer 模型,它使用内存层次结构和量化技术来适配 24-32 GB 的内存限制。
使用一天后,我觉得可以这么说:Muse-Glimmer-30B 在部分使用场景下终于以同等规模击败了 3.6-27B
一位用户报告称,Muse-Glimmer-30B 在推理效率和常识知识方面优于 Qwen3.6-27B,但在编码方面稍弱,使其成为 24GB GPU 上的可行选择。
推出 Muse Glimmer
Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。