标签
PrismML 宣布推出 Bonsai 27B,这是 Qwen3.6 27B 的二值量化版本,可在手机上运行,每个权重仅使用 1.125 比特,声称保留了 89.5% 的智能。该模型正由 @sudoingX 独立测试以验证性能。
Mixedbread Search 引入了非对称量化用于后期交互检索,通过将文档向量存储为二进制符号,同时保持查询向量为更高精度,实现了近无损质量且存储减少97%。
NanoQuant是一种灵活的二进制量化方法,可将稠密Transformer压缩至每个权重低于1比特。本仓库提供了一个PyTorch实现,仍在开发中,能够量化Qwen3-0.6B和Qwen3-4B等模型。