binary-quantization

标签

Cards List
#binary-quantization

@sudoingX: 这个实验室将 Qwen 3.6 27B(这个我整个月都称之为 24GB 层级霸主的模型)压缩到了 3.9GB。……

X AI KOLs Timeline · 2026-07-16 缓存

PrismML 宣布推出 Bonsai 27B,这是 Qwen3.6 27B 的二值量化版本,可在手机上运行,每个权重仅使用 1.125 比特,声称保留了 89.5% 的智能。该模型正由 @sudoingX 独立测试以验证性能。

0 人收藏 0 人点赞
#binary-quantization

非对称量化:实现近无损检索且存储降低97%

Hacker News Top · 2026-06-29 缓存

Mixedbread Search 引入了非对称量化用于后期交互检索,通过将文档向量存储为二进制符号,同时保持查询向量为更高精度,实现了近无损质量且存储减少97%。

0 人收藏 0 人点赞
#binary-quantization

NanoQuant的一种实现:一种灵活的二进制量化方法

Reddit r/LocalLLaMA · 2026-06-08

NanoQuant是一种灵活的二进制量化方法,可将稠密Transformer压缩至每个权重低于1比特。本仓库提供了一个PyTorch实现,仍在开发中,能够量化Qwen3-0.6B和Qwen3-4B等模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈