Muse Glimmer 30B:512k上下文
摘要
本文描述了如何利用Muse Glimmer 30B模型的独特架构(在SWA层中使用RoPE,在GQA注意力层中没有位置编码)将其上下文扩展到512k令牌,基准测试结果显示在高达512k令牌时性能出色。
我的周末趣味项目是尝试让新的Muse Glimmer 30B模型支持更长上下文,首先决定设定为512k。我原以为会需要常见的YaRN调整或LoRA适配。我大错特错了。仔细观察后发现,Glimmer在架构上非常独特。在其他模型中让长上下文适配变得困难的因素——带有令牌位置编码的全注意力层——在这里根本不存在。相反,只有2048令牌宽的SWA层使用了RoPE,而完整的GQA注意力层完全没有位置编码。似乎该模型被训练为从上下文和SWA层中推断长距离令牌关系来工作。这是一个相当大胆的架构赌注,但Meta似乎成功实现了。因此,该模型架构似乎特别适合通过简单的机械手段扩展上下文。要将模型上下文长度从默认的128k更改为512k,只需将配置设置中的“max_position_embeddings”从131072改为524288。在其他模型如Qwen3.5系列中令人困惑的问题,Glimmer却轻松应对。我在DGX Spark上花费了近70小时的计算资源,测试了默认模型在扩展上下文下的各种基准,并在全精度模型上发现以下结果:大海捞针,1针和4针:在高达512k令牌时达到100%;多跳检索:在高达512k令牌时达到100%;语义查找:在高达512k令牌时达到100%;整个上下文中的实例计数:从32k时的95%下降到385k时的约60%,然后在512k时降至22%;模拟代理会话中的内存使用:在高达385k时达到100%,然后略有下降;NoLiMa:结果有些嘈杂,但在高达512k的所有上下文中似乎稳定;LongBench v2:在高达512k令牌时性能相同;LongCodeQA:在高达512k令牌时性能相同;我还尝试了InfBench套件,但结果有些嘈杂,我仍在努力优化。完整的研究档案、脚本和报告公开在这里:https://github.com/lobanov/muse-glimmer-long-ctx
相似文章
我在 1M 上下文下运行了 Muse Glimmer - 所有测试均通过。
用户在 2× DGX Spark 集群上测试了 Meta 的 Muse Glimmer 30B,使用 YaRN 将上下文从 131K 扩展到 1M tokens,并确认在 832K tokens 下通过检索。报告称 DFlash 投机解码带来了约 3 倍加速,并分享了完整配置。
Muse Glimmer 居然真的能装进单张 RTX 3090
用户报告称,30B 参数的 Muse Glimmer 使用 Q4_K_XL 量化和 DFlash,在单张 RTX 3090 上即可运行,并支持完整的 256k 上下文,速度达到 64-124 tok/s,且长上下文检索完美,与同类模型不同。
Muse Glimmer 是一个伪装成 30B Transformer 的内存层次结构
Meta 的 Muse Glimmer 是一款为消费级硬件上的自主代理任务设计的 30B 多模态 Transformer 模型,它使用内存层次结构和量化技术来适配 24-32 GB 的内存限制。
推出 Muse Glimmer
Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。
推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。