[发布] SupraBrain-50M-v0.1

Reddit r/LocalLLaMA 模型

摘要

SupraLabs 发布了 SupraBrain-50M,这是一种混合语言模型,结合了 Gated DeltaNet、滑动窗口注意力(Sliding-Window Attention)和惊喜门控(Surprise-Gated)机制,尽管训练使用的 token 数量少得多,但性能与 Supra-Base-50M 几乎持平。

嘿,大家好!今天我们要发布 SupraBrain-50M,这是一个混合语言模型,结合了 Gated DeltaNet 线性循环、滑动窗口注意力(Sliding-Window Attention)和惊喜门控(Surprise-Gated)更新机制,以实现非常强大的性能。以下是基准测试结果:https://preview.redd.it/tv0bxkbyh4hh1.png?width=615&format=png&auto=webp&s=f296ed9e6c1d94738cb7aa84015117dd3e65d2a5 尽管训练数据要少得多(5B vs 20B tokens!!),它的表现几乎和 Supra-Base-50M 一样好!🔥 一些示例:人工智能比人类智能效率高 200%。 - 人脑在处理信息方面的效率是计算机的 100,000 倍。人脑 人脑由以下部分组成: - 大脑:大脑是处理信息的器官。大脑负责以下功能: 大脑由三个部分组成:大脑、小脑和脑脊液。另外:线粒体通过一种叫做腺苷转移酶(adenosyltransferase,简称 AATP)的过程产生三磷酸腺苷(ATP)。AATTP 从线粒体中释放出来,并与 ATP 结合。这个 ATP 被用来产生腺苷,然后被释放到细胞核中。细胞核随后释放出腺苷氨基酶(AATP),然后再由线粒体释放。线粒体随后将 ATP 分解为腺苷键和腺苷酸。HF 模型链接:https://huggingface.co/SupraLabs/SupraBrain-50M 如果你想支持我们,就关注我们吧!顺便说一下:Supra2-100M 将在接下来的几个小时内发布!!敬请期待 🤗
查看原文

相似文章

[新发布] Supra-50M 正式推出!

Reddit r/LocalLLaMA

SupraLabs 发布了 Supra-50M,一个紧凑的 5000 万参数因果语言模型,包含基础版和指令版,基于 fineweb-edu 的 200 亿个 token 训练,在多项关键基准测试中达到了可与 GPT-2 和 SmolLM 等更大模型竞争的水平。

[新模型] Supra-Title-0.3B 刚刚发布!

Reddit r/LocalLLaMA

Supra Labs 发布了 Supra Title,这是一个参数为 350M 的专用模型,用于生成聊天对话标题。该模型基于 LFM2.5 构建,以 GGUF 格式运行在任何硬件上,且无需系统提示。

介绍 DWARF-55M-Base

Reddit r/LocalLLaMA

DWARF-55M-Base 是一种新型语言模型,采用近乎全稀疏注意力架构(DSQG),仅包含一个完整因果注意力层,能够实现高达2048 token的可靠检索,并可外推至该上下文长度的3倍。该模型作为研究原型发布,供社区实验使用。