ternary-weights

标签

Cards List
#ternary-weights

deepgrove/maple-preview

Hugging Face Models Trending · 2026-08-04 缓存

DeepGrove 发布了 Maple-Preview,这是一款开源的 20B-A1B 三值权重推理大语言模型,在同类权重规模中推理能力达到最先进水平,在 Mac mini M4 上每秒可生成 200+ tokens,并与更大模型相比具有竞争力。

0 人收藏 0 人点赞
#ternary-weights

思路:在CPU上,解码速度取决于每个token的活跃参数,而非总参数。我的目标是尝试在中等配置PC(无GPU)上以100tok/s运行一个10B模型。

Reddit r/LocalLLaMA · 2026-07-29

提出了CPU解码速度取决于每个token的活跃参数而非总参数的见解,并提出一个使用三元权重和细粒度MoE的10B参数模型,以在中等配置PC上实现高token速率。报告了沙箱测量结果,显示在8.3M模型上速度从176 tok/s提升到848 tok/s,且质量损失极小。

0 人收藏 0 人点赞
#ternary-weights

Neutrino-1 8B

Hacker News Top · 2026-07-28 缓存

Neutrino-1 8B是一个拥有8.19B参数、采用专有三值权重格式的Transformer模型,使其能够部署在8GB显存的GPU上,并从一个仅3.88GB的模型文件中以高解码速度服务多个平台。

0 人收藏 0 人点赞
#ternary-weights

prism-ml/bonsai-image-ternary-4B-gemlite-2bit

Hugging Face Models Trending · 2026-05-21 缓存

Prism ML发布Bonsai Image,一个1.21 GB的文本到图像扩散变换器,使用三元权重(1.58-bit)用于NVIDIA GPU,在RTX 3080上4.5秒生成1024²图像,体积远小于FP16。

0 人收藏 0 人点赞
#ternary-weights

Ternary Bonsai:1.58 比特下的顶级智能

Hacker News Top · 2026-04-18

一种使用三值权重(-1、0、1)的高效 AI 模型架构,仅需 1.58 比特/参数即可实现具有竞争力的性能,可部署在极度受限的设备上。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈