你认为5t/s对于本地模型来说是可用的吗?
摘要
用户探讨了以5t/s速度本地运行Qwen3.8 27b模型的实用性,对比了不同硬件配置的性能,并说明在系统资源管理合理的情况下,较低速度仍可接受。
我的系统可以两种方式运行qwen3.8 27b:一种是分配到3060 12gb和9070xt上,速度达到20t/s;另一种是仅使用780m iGPU和5400mhz DDR5,速度为5t/s。个人而言,我觉得5t/s仍然更可用,因为我有足够的RAM,系统基本上还能正常使用。我甚至可以正常玩游戏,因为CPU部分没有负担。说实话,在我看来这很酷,因为它让模型更加实用:我可以直接启动它,然后继续正常使用我的系统,即使获得答案需要4倍的时间。
相似文章
大家在 Qwen3.6 27b 上跑出来的速度是多少?
用户基准测试 Qwen3.6-27B-Q8_0,在 3 块混合 GPU 上通过 llama.cpp 以约 13 tokens/sec 运行 128k 上下文,询问该性能是否典型。
你计划如何在本地运行 Qwen3.8-2.4T-A95B?
一个社区帖,询问爱好者们计划如何在本地运行大型 Qwen3.8-2.4T-A95B 模型,并分享在个人硬件上运行巨大 AI 模型的挣扎。
本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实测数据
本文提供了在 Mac Studio 上本地运行 Qwen3.8 27B AI 模型的实际性能基准测试,将其与前代模型进行比较,并讨论了硬件要求和量化效果。
Qwen 3.8 27B 比预期更快
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难
作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。