@rohanpaul_ai: Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上达到每秒34个token,本地使用 atomic[.]chat,接受率达90%,即……
摘要
Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上本地运行,实现每秒34个token,草稿接受率达90%,通过 TurboQuant、GGUF 和 llama.cpp 实现,展示了笔记本AI推理的重大进步。
Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上本地运行,达到每秒34个token,使用 atomic[.]chat,接受率达90%,即大多数草稿token与主模型本应生成的token匹配,因此速度提升并非来自跳过质量检查,而是避免了重复的全量解码工作。TurboQuant 和 GGUF 处理存储和运行时方面:模型被压缩到足以本地运行,而 llama.cpp 可以高效地向 Apple Silicon 提供数据,无需等待巨大的权重移动。这是一个相当厉害的本地推理结果,改变了人们对“笔记本AI”的体验感受。
相似文章
@RoundtableSpace: Qwen 3.8 27B 在本地 RTX 5090 上运行时,在个人基准测试中击败 Opus 4.8,速度高达每秒200个令牌,无需...
Qwen 3.8 27B 是一个拥有270亿参数的AI模型,在本地RTX 5090 GPU上运行时,在个人基准测试中超越Opus 4.8,速度高达每秒200个令牌,无需互联网或API访问。
@rohanpaul_ai: 精美的视觉展示,有人在本地运行 Qwen 3.8 27B,使用 RTX 5090 32 GB 显存系统,速度达到 115 tokens/秒 注意,Qw…
推文重点介绍了在 RTX 5090 系统上本地运行 Qwen 3.8 27B 模型,配备 32GB 显存,达到 115 tokens/秒的速度,并指出官方 BF16 检查点大小为 55.6GB。
@Xudong07452910: Hacker News 上有一篇评论区火了的文章:Qwen 3.6 27B 是本地开发的理想选择。 核心发现是:密集参数模型、原生支持 256k 上下文,在 MacBook Max M5 上跑 Q8_0 量化版能达到 30 tokens/…
Qwen 3.6 27B is a dense 27B model that achieves impressive performance on local hardware with 256k context, running at 30 tokens/s on MacBook Max M5 and 50 tokens/s on RTX 5090, and is considered by some as the first local model with true general intelligence.
Qwen3.8-27B在M5 Max MacBook Pro上实现144 tok/s速度
Inco Splash是一款针对Apple silicon优化的开源推理引擎,在M系列MacBook上运行Qwen3.8-27B等AI模型时提供了显著的速度提升。
Qwen3.8-27B在24GB RTX PRO 4000 SFF上以256K上下文运行(432 GB/s带宽):通过MTP实现每秒50个token
本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。