新的 Muse-Glimmer-30B SoTA 量化版本——希望是新的阵容 :)

Reddit r/LocalLLaMA 模型

摘要

作者发布了 Muse-Glimmer-30B 模型的新 SoTA 量化版本,声称它们通过新颖的技术在各类 VRAM 中优于现有量化版本,其中包括一个更小且更接近 BF16 的 Q8 量化版本。他们在 HuggingFace 上分享了方法论,并讨论了未来的文章。

大家好,我做量化版本已经有段时间了——最近我短暂休息了一下,投入到硬核研究中(期间提交了我的第一篇 EMNLP 论文!)。在这个过程中,我积累了一些量化优化技巧:从新颖的、待发表论文的技巧,到一些真正厉害的张量映射算法。我把一些秘密配方用在了新发布的 Muse Glimmer 30B 上(META IS BACK!),并和几个 OG 模型进行了对比。说实话,我很震惊它在每一档 VRAM 级别上都不会输给任何现有量化版本!其中最酷的一个是我的 Q8 量化版本,它比 UD-Q8_K_XL 更小,并且接近 BF16 的程度提高了 21%。完整方法论在模型卡片上——评估设置、置信区间、保留切片等等。欢迎在评论区提问。模型:https://huggingface.co/AaryanK/Muse-Glimmer-30B-GGUF 我原本还有优化空间,但计算额度用完了 :( 作为一个独自搞研究的本科大二学生,我不能经常花 H100 的钱,这就是标题里“希望是”的原因 :) 我正在寻找 AI 代理编排和模型推理方面的实习机会。如果这项工作与你的团队相关:linkedin.com/in/theaaryankapoor 我计划很快写一篇详细介绍其中一些秘密配方的文章! https://preview.redd.it/yzf6n2fyuuih1.png?width=1860&format=png&auto=webp&s=aa8b615918c447001f816f891e7f52d758c72548 https://preview.redd.it/tgkxp30wuuih1.png?width=1920&format=png&auto=webp&s=366cf095528f9c2cd8ca7aa3e8d49a946085b374 https://preview.redd.it/0rcl5o70vuih1.png?width=1980&format=png&auto=webp&s=e1fddd2f83e395198fb75e37145d7eaadd72a916 祝大家推理更上一层楼!
查看原文

相似文章

Muse Glimmer 居然真的能装进单张 RTX 3090

Reddit r/LocalLLaMA

用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。

推出 Muse Glimmer

Simon Willison's Blog

Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。