标签
本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。
作者在 VLLM 上对 27B 模型进行了实验,通过混合 low 和 xhigh 模式的提示,创建了一个“high”推理模式,从而获得了更高效、更愉快的推理输出。
用户报告在Jetson Orin NX 16GB边缘设备上成功运行了量化到1-bit的27B参数模型,对可行性表示惊讶。
Ternary Bonsai 27B,一个大型语言模型,被演示在NVIDIA RTX 5090 GPU上本地运行,内存需求低于6GB,使消费级硬件上实现端到端的智能代理工作流成为可能。
PrismML宣布推出Bonsai 27B,这是一个基于Qwen3.6 27B的多模态模型,可以在手机上运行,支持本地多步推理、工具使用和长上下文工作流。
作者构建了一个自主开发流水线,并通过在改装版RTX 4090上运行27B本地模型与使用廉价云端大语言模型API对同一个项目进行基准测试。
介绍了一个新的27B后训练模型,该模型从Fable和Kimi 2.7 Coder中提炼优点,并附有下载链接。