Glimmer 1 - Glint Research. 一个基础的10,000参数语言模型
摘要
介绍了Glimmer,一个10,000参数的语言模型,在FineWeb-Edu的50万个token上训练,采用标准Llama架构,可在HuggingFace上获取。
我们介绍了Glimmer,一个在FineWeb-Edu的50万个token上训练的10k基础模型。上下文窗口为512个token。架构是标准Llama(LlamaForCausalLM),16个隐藏维度,2层,4个注意力头,1个KV头(GQA)。其余信息详见 [https://huggingface.co/Glint-Research/Glimmer-1-Base](https://huggingface.co/Glint-Research/Glimmer-1-Base)。只要这个帖子还在,就随便问吧。玩得开心!
\# 基准测试
* arc\_easy (acc): 25.46%
* wikitext-2 (word\_perplexity): 1,765,201
* wikitext-2 (byte\_perplexity): 14.73
* wikitext-2 (bits\_per\_byte): 3.8806
* BLiMP (acc): 52.43%
相似文章
推出 Muse Glimmer
Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。
unsloth/GLM-5.3-Flash-GGUF
GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活跃参数,采用混合稀疏线性注意力架构以降低成本,同时在基准测试中性能超越前代版本并接近 Claude Opus 4.8。
zai-org/GLM-5.3-Flash
GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活动参数,通过重新设计的混合架构提高了效率,性能超越之前的版本并接近 Claude Opus 4.8。
推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。
Meta Muse Glimmer – 开放权重的30B本地编码模型
Meta推出Muse Glimmer,一个采用宽松许可的30B参数模型,专为本地智能体工作流、编码和工具使用而优化,权重已在Hugging Face上发布。