@alexocheema:在两台 M5 Max MacBook Pro 上通过 Thunderbolt 5 RDMA 运行 Qwen3.6 35B(视觉版)。模型能描述图片并正确识别 Apple Park,但把 John Ternus 错认成 Jeff Williams。借助前缀缓存,响应几乎瞬间完成。
摘要
在两台 M5 Max MacBook Pro 上通过 Thunderbolt 5 RDMA 运行 Qwen3.6 35B(视觉版)。模型能描述图片并正确识别 Apple Park,但把 John Ternus 错认成 Jeff Williams。借助前缀缓存,响应几乎瞬间完成。
在两台 M5 Max MacBook Pro 上通过 Thunderbolt 5 RDMA 运行 Qwen3.6 35B(视觉版)。模型能描述图片并正确识别 Apple Park,但把 John Ternus 错认成 Jeff Williams。借助前缀缓存,响应几乎瞬间完成。
查看缓存全文
缓存时间: 未知
在两台 M5 Max MacBook Pro 上通过 Thunderbolt 5 的 RDMA 运行 Qwen3.6 35B(视觉版)。它能描述图片并正确识别 Apple Park,但把 John Ternus 误认成了 Jeff Williams。借助前缀缓存,响应几乎瞬时。
相似文章
@remilouf: 在 @julien_c 的推文之后,我买了一台配备 128B 统一内存的 MacBook Pro,并开始将 Qwen3.6 作为我的日常驱…
作者分享了在配备 128GB 统一内存的 MacBook Pro 上运行 Qwen3.6 模型的经验,称赞了苹果硬件在本地 AI 推理方面的效率。
在128 GB M5 Max上运行Qwen3.8-Flash-Next(79 GB,2-bit)以350K上下文持续3.5小时——速度与上下文深度权衡,100轮对话,一张图表
本文报告了在MacBook Pro M5 Max上运行Qwen3.8-Flash-Next模型的情况,对100轮对话中速度与上下文深度进行基准测试,并深入分析性能及长上下文下角色混淆等问题。
@AlexJonesax:在M5Max上启用MTP和oMLX推理,Qwen3.6-27b飞速运行
社区报告称,通过oMLX优化,Qwen3.6-27b模型在M5Max硬件上实现了极高的推理性能。
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。
在M1 Max上使用Zoo Code运行Qwen 3.6 35b MoE真是太棒了!完全本地化、电池供电的编码利器!
本文讨论了在Apple M1 Max Mac上使用Zoo Code本地运行Qwen 3.6 35b混合专家模型,突出其作为电池供电的编码助手的能力。