Glimmer 1 - Glint Research. 一个基础的10,000参数语言模型

Reddit r/LocalLLaMA 模型

摘要

介绍了Glimmer,一个10,000参数的语言模型,在FineWeb-Edu的50万个token上训练,采用标准Llama架构,可在HuggingFace上获取。

我们介绍了Glimmer,一个在FineWeb-Edu的50万个token上训练的10k基础模型。上下文窗口为512个token。架构是标准Llama(LlamaForCausalLM),16个隐藏维度,2层,4个注意力头,1个KV头(GQA)。其余信息详见 [https://huggingface.co/Glint-Research/Glimmer-1-Base](https://huggingface.co/Glint-Research/Glimmer-1-Base)。只要这个帖子还在,就随便问吧。玩得开心! \# 基准测试 * arc\_easy (acc): 25.46% * wikitext-2 (word\_perplexity): 1,765,201 * wikitext-2 (byte\_perplexity): 14.73 * wikitext-2 (bits\_per\_byte): 3.8806 * BLiMP (acc): 52.43%
查看原文

相似文章

推出 Muse Glimmer

Simon Willison's Blog

Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。

unsloth/GLM-5.3-Flash-GGUF

Hugging Face Models Trending

GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活跃参数,采用混合稀疏线性注意力架构以降低成本,同时在基准测试中性能超越前代版本并接近 Claude Opus 4.8。

zai-org/GLM-5.3-Flash

Hugging Face Models Trending

GLM-5.3-Flash 是 GLM-5 系列中首个原生多模态模型,拥有 3200 亿总参数和 180 亿活动参数,通过重新设计的混合架构提高了效率,性能超越之前的版本并接近 Claude Opus 4.8。