Neutrino-1 8B

Hacker News Top 模型

摘要

Neutrino-1 8B是一个拥有8.19B参数、采用专有三值权重格式的Transformer模型,使其能够部署在8GB显存的GPU上,并从一个仅3.88GB的模型文件中以高解码速度服务多个平台。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:28

# Neutrino-1 8B 来源:https://www.fermionresearch.com/models/neutrino-8b/ 可用时间:2026\-07\-27 Neutrino 系列的旗舰产品:在编码三进制族容器之后的36个解码器层,该容器从一个构件为数据中心 GPU、MacBook 和桌面 CPU 提供服务。 2.56 GB下载,无损1/8 fp16 的比特数72.1MMLU763 tok/s规范解码,H100 Neutrino\-1 8B Neutrino\-1 8B 是一个 8.19B 参数的纯解码器 Transformer,以单个 3.88 GB 文件形式发布。其 252 个 Transformer 线性层全部采用专有的三进制族权重格式存储,大小仅为 fp16 的八分之一;权重在静态时保持比特打包状态,并在矩阵内核内部解码,因此解码路径中没有任何部分以 fp16 或 fp32 权重材料存储。 小权重改变了服务经济性。单流解码受限于每个 token 移动的字节数,因此 3.88 GB 的工作集在相同内存系统上的解码速度是 16 GB fp16 构件无法达到的,并且整个模型连同其 KV 缓存可以放入 8 GB GPU 或 16 GB 笔记本电脑。同一容器无需转换即可为以下所有平台提供服务。 一个密集的纯解码器 Transformer。分组查询注意力将 KV 缓存保持在查询宽度的四分之一,每个 token 在 fp16 下为 144 KiB,因此一个 4k token 的会话在权重 3.88 GB 之外需要 0.60 GB 的缓存。 基础模型Apache\-2.0,阿里云Qwen3\-8B参数6.95B 编码投影权重,1.24B int8 嵌入,0.3M 归一化8,190,735,360解码器层36隐藏宽度4,096前馈宽度门控 (SwiGLU),每层三个线性层12,288注意力分组查询 4:1,头宽度 12832 个查询头,8 个键值头KV 缓存fp16;4k 上下文时 0.60 GB,32k 时 4.83 GB每个 token 144 KiB位置编码应用于整个 128 宽头旋转,基数 1,000,000归一化plus per\-head query/key RMSNorm inside attentionRMSNorm,eps 1e\-6上下文长度40,960 个 token词汇表151,936嵌入输入嵌入和输出头是独立的张量非绑定几何结构从所发布容器的头部读取。### 字节分布 只有 Transformer 线性层采用编码格式。两个嵌入张量保持 int8,因为它们的行一次只读取一个 token,而不是与完整的激活流相乘,并且归一化权重太小,不值得编码。文件的三分之一是词汇表。 252 个 Transformer 线性层编码三进制族通道,占文件的 67.2%:查询、键、值、输出投影以及门控、上、下前馈线性层,每层 7 个,每层 72,351,744 字节2,605 MBToken 嵌入占文件的 32.1%:两个未绑定的 int8 张量,151,936 × 4,096,输入嵌入和输出头,每行一个缩放因子1,245 MB每行元数据0.6%:行维度、缩放因子和行和25 MB归一化权重145 个张量,保持 float32:每层四个加上最终归一化1.2 MB容器头部60 字节3,875,404,812 字节容器的字节预算,按张量类别划分。### 编码通道内部 在 6.95B 编码权重中,62.63% 为零,其余 18.68% 为正,18.69% 为负:在不要求符号平衡的约束下,符号平衡到百分之一以内。这种平衡在深度上并不均匀。在第 1 层到第 3 层中,门控和前馈下投影的零值比例高达 70% 到 72%,而所有四个注意力投影在每个深度都保持在约 62% 左右:早期前馈块会丢弃网络不需要的权重,而注意力从第 0 层到第 35 层保持恒定的编码密度。 gateupdownquery, key, value, output 60%65%70%08162435 60%65%70%08162435 每个投影中编码权重为零的比例,覆盖所有 36 层。 一个容器,三道门。下载是容器的编码传输,而不是 fp16 模型的压缩副本:它以位精确的方式扩展为每个运行时执行的文件,并且该单个文件既可以在数据中心 GPU 上运行,也可以在笔记本电脑上运行。 下载编码传输,2,559,822,594 字节;扩展是位精确的2.56 GB磁盘上一个容器,3,875,404,812 字节3.88 GB### 分发界面 #### pip 引擎 24.9 tok/s,Apple M5,仅 CPU,9 线程 一键命令:pip install fermion-research 下载容器和平台匹配的本地二进制文件。CPU 运行时适用于 macOS arm64 和 Linux x86\-64,底层还有位精确的 torch 参考路径。 #### GGUF 包 + CUDA 分支 30.7 tok/s,NVIDIA L4,4k 上下文时 4.68 GiB llama.cpp 门:容器使用我们的权重类型转换为 GGUF,由我们的公共 llama.cpp 分支加载。运行 llama-completion 和 llama-bench,支持完整的 CUDA 卸载。 #### MLX 包 33.7 tok/s,基础 M5 MacBook Apple 芯片门:使用自定义 Metal 内核的 Python 原生运行时。容器被内存映射,打包平面在 GEMV 内核内部解码。 发布评测基于已发布的容器运行,且禁用思考,因此以下所有评分都是您下载的构件,而不是研究检查点。协议贯穿每一行:镜头数、评分模式和项目数。 MMLU5\-shot,所有 57 个科目,14,042 个项目72.1MMLU\-Redux生成式,重新注释的子集,思考关闭67.8IFEval,提示严格生成式,思考关闭77.2IFEval,指令严格相同运行,按指令评分80.2IFEval,提示宽松相同运行,宽松提取76.3BFCL v3在 13 个子集上取宏平均,思考关闭68.9GSM8K,灵活提取0\-shot 生成式,贪婪,256 个 token 上限53.4GSM8K,指定格式相同运行,仅接受所请求形式的答案51.73在标准公共测试工具上测量,2026 年 7 月。方法详见模型卡片。 单流解码,控制一个提示和一个回复的速率。每行使用相同的构件;界面变化,权重不变。 H100 80 GB,带草稿0.6B 草稿 + 8B 验证,输出与纯解码相同;最快提示类别763 tok/sH100 80 GB纯单流贪婪396 tok/sNVIDIA L4,CUDA 分支GGUF 包,完全卸载,4k 上下文时 4.68 GiB VRAM;适合 8 GB 卡30.7 tok/sApple M5,16 GB (MLX),带草稿事实性提示,同一进程中的 0.6B 草稿,上限 6 GiB25.7 tok/sApple M5 MacBook (优化)已发布构件上的单流解码33.7 tok/sApple M5 (仅 CPU)已发布的原生二进制文件,9 线程24.9 tok/s按平台和界面划分的单流解码速率,2026 年 7 月。 Neutrino\-1 0.6B 草稿生成一系列 token,8B 在一次前向传递中评分整个序列,并且保留一致的前缀。只有当草稿 token 等于 8B 自身的 argmax 时才被接受,因此输出流是纯粹的贪婪流:在发布配置下,27,648 个连续 token 匹配,零分歧。 加速取决于草稿接受物理特性,因此按提示类别相对于 396 tok/s 的纯速率给出。在计数提示上,8B 每次传递接受完整的六个 token 草稿,每次 8B 前向传递大约发出七个 token;在事实性提示上,接受率保持在 96.5%。动态控制器根据正在解码的类别调整每个草稿的大小,这就是为什么每个类别都超过纯速率。 计数和列表763 tok/s×1.93事实性短答案613 tok/s×1.55散文续写532 tok/s×1.34对话式解释447 tok/s×1.13代码426 tok/s×1.07H100,每个提示类别三轮中位数,相对于 396 tok/s 的纯解码。### 配对成本 两个容器格式相同,并在相同的二进制文件上运行,因此草稿加载到验证器自己的进程中,无需二次部署和转换步骤。其 328 MB 与 8B 的 3.88 GB 并存,4k token 的共享上下文在两者之间恰好消耗一个 GiB 的缓存。 一个进程,一组二进制文件Neutrino\-1 8B3.88 GB,验证器Neutrino\-1 0.6B328 MB,草稿六个提议 token接受的前缀发出的一个进程,一组二进制文件Neutrino\-1 0.6B,328 MBNeutrino\-1 8B,3.88 GB六个提议 token接受的前缀常驻权重3.88 GB 验证器加 328 MB 草稿,一个进程4.20 GB草稿开销配对所花费的额外权重字节8.46%共享缓存8B 上 144 KiB,草稿上 112 KiB;4k 上下文时 1 GiB每 token 256 KiB认证运行草稿加验证与纯贪婪对比,零分歧27,648 token绘制成字节尺度的草稿对,以及每侧花费的常驻内存。### 在笔记本电脑上草稿 配对不是数据中心特性。在 16 GB Apple M5 上,两个模型加载到一个 MLX 进程中,上限 6 GiB,总共峰值 4.3 GiB,其中草稿占用 0.53 GiB。精确性门控在打开和关闭草稿的 6 个提示中返回 token 相同的结果,并且在事实性提示上,草稿速率为 25.71 tok/s,而纯速率为 22.00 tok/s,接受率为 0.744。 ### 两条命令即可进入流式聊天。 `` $ pip install fermion-research$ fermion chat `` 首次运行会拉取容器和主机的原生二进制文件,然后打开提示。后续运行从缓存加载。 - 本地 OpenAI 兼容服务器`fermion serve` 在 http://127\.0\.0\.1:8000/v1 提供服务。将任何 OpenAI 客户端指向该基础 URL;密钥可以是任意字符串。 - 三个模型中的任意一个`fermion chat \-\-model fermionresearch/Neutrino\-0\.6B\-Chat` \-\-model 接受仓库 ID 或磁盘上的路径。\-\-backend native 将编译的运行时固定为使用,而不是 torch 路径。 - GGUF,通过我们的 llama.cpp 分支`llama\-completion \-m neutrino\-8b\-fv5\.gguf \-ngl 99` 构建该分支,然后从模型仓库运行包。CUDA 构建卸载所有 36 层。 - MLX,在 Apple 芯片上`python \-m fermion\_mlx \-\-model neutrino\-8b\_v4\.bin \-\-mode chat \-\-tokenizer \.` 从模型仓库的 mlx/ 文件夹运行,安装其 requirements 文件后。 完整引擎文档 (https://www.fermionresearch.com/learn/) Neutrino\-1 8B 以单个公共仓库形式发布,其中包含权重、原生二进制文件、GGUF 包和 MLX 包,因此永远不会出现不匹配的版本。无需等待列表,无需门控预览。 权重和引擎放在一个仓库中。 可用时间:2026\-07\-27一个公共仓库开放权重,Apache 2.0 ### 许可 在 Apache 许可证 2.0 下开放权重。允许商业使用、修改、微调和再分发,无需访问请求和接受表单。该模型是 Qwen3\-8B 的衍生品,后者本身也是 Apache\-2.0 许可。pip 包也是 Apache\-2.0;llama.cpp 分支是 MIT 许可,遵循上游 llama.cpp。 ### 引用 `` @misc{fermionresearch2026neutrino, title = {Neutrino-1 8B}, author = {{Fermion Research}}, year = {2026}, url = {https://fermionresearch.com/models/neutrino-8b/} } ``

相似文章

Nemotron-3-Embed 1B/8B

Reddit r/LocalLLaMA

NVIDIA 发布了 Nemotron-3-Embed 1B 和 8B 模型,这是最先进的多语言文本嵌入模型,用于检索和语义相似度,针对 RAG 系统进行了优化。

prism-ml/bonsai-image-ternary-4B-gemlite-2bit

Hugging Face Models Trending

Prism ML发布Bonsai Image,一个1.21 GB的文本到图像扩散变换器,使用三元权重(1.58-bit)用于NVIDIA GPU,在RTX 3080上4.5秒生成1024²图像,体积远小于FP16。

nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4

Hugging Face Models Trending

NVIDIA 发布 Nemotron-3-Ultra,一个拥有 5500 亿参数的开源权重模型,采用结合 Mamba-2、MoE 和注意力的混合架构,支持高达 100 万 token 的上下文长度和可配置的推理模式。

nvidia/Nemotron-Labs-Diffusion-14B

Hugging Face Models Trending

NVIDIA发布了Nemotron-Labs-Diffusion,这是一个三模式语言模型系列(3B、8B、14B),支持自回归(AR)、扩散和自推测解码,相比标准AR解码实现了2.7倍到4倍的加速。