@BenjaminDEKR: 我现在正在用一块 5070 Ti(16GB 显存)进行测试,目前的表现真的非常令人印象深刻。
摘要
一名用户正在使用 NVIDIA 5070 Ti GPU 测试新发布的 Ternary Bonsai 2 27B AI 模型,这是 Qwen3.8 27B 的更小且量化版本,并对其性能感到印象深刻。
查看缓存全文
缓存时间: 2026/09/18 02:29
我现在正在用5070 Ti(16GB显存)测试这个,目前表现非常令人印象深刻。
PrismML (@PrismML): 今天,我们宣布推出Ternary Bonsai 2 27B模型。
基于Qwen3.8 27B架构的Bonsai 2 27B,在整体尺寸缩小9倍的情况下,仍保留了全精度版本98.2%的基准测试综合性能。
距首款Bonsai 27B发布两个月后,本次更新最大的改变在于质量提升。
相似文章
@BenjaminDEKR: 这里是我对NVIDIA 5070 Ti GPU(16GB显存)上Qwen-Image-2.1的测试结果 它能运行,并且相当快。大约25秒生成1024²图像…
在NVIDIA 5070 Ti GPU上对Qwen-Image-2.1的测试表明,它能在16GB显存内运行,生成1024²图像的时间约为25秒,并突出了出色的提示词遵循和排版能力。
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。
对于拥有12GB GPU的用户,现在可以通过新的Ternary版本运行QWEN 3.6 27B,损失很小。
Qwen3.6 27B的新三元量化版本,名为Bonsai 27B,可以在12GB GPU上运行,内存需求减少10倍,性能达到原版的95%,使其适用于本地部署。
有人在5070ti(16GB)上运行qwen 3.8 27b吗?
用户询问在配备16GB显存的5070ti GPU上使用量化运行Qwen 3.8 27b模型是否可行,主要用于智能体编码。