21款GPU运行小型TTS模型基准测试(显存峰值:5GB)
摘要
一位用户在vast.ai上对21款消费级GPU进行了基准测试,运行小型TTS模型(OmniVoice),显存峰值5GB,比较了相对于实时速度和RTX 3090的性能。
我在vast.ai上租用了不同的GPU,每块使用几分钟,对一个小型TTS模型OmniVoice进行基准测试,该模型显存峰值约5GB。我想测试各种主流消费级GPU与我自己的RTX 3090相比表现如何。这绝不是一次广泛或科学性的分析,但我认为它大致能体现这些GPU之间的相对性能。xRT表示实时倍数,即GPU生成音频比实时快多少。在提供参考音频的情况下,对一个小段落进行3次平均测试(声音克隆)。
相似文章
在6GB RTX 4050上对20个小LLM的基准测试
对20个为6GB GPU量化的小LLM的详细基准测试,测量了不同上下文长度下的速度和VRAM使用情况,并对工具使用和指令遵循进行了定性探针。该报告旨在帮助拥有中等硬件的用户为本地私有的自动化任务选择模型。
4090 + 5060 Ti + 64GB RAM:35B-A3B 达 206 t/s,122B 达 37 t/s
一位用户分享了在双 GPU(RTX 4090 和 RTX 5060 Ti)上运行大语言模型(Qwen 27B-122B)的基准测试结果,实现了极高的 token 生成速度(例如 35B-A3B 达到 206 t/s,122B 达到 37-41 t/s)。帖子包含配置详情以及指向 GitHub 仓库的链接,其中包含脚本和原始数据。
在Strix Halo、RTX 3090和RTX 5070上运行相同模型,只为获得自己的数据
作者在Strix Halo、RTX 3090和RTX 5070上使用了多个后端,进行了55次推理基准测试。结果揭示,显存带宽主导解码速度,RTX 5070在小模型上击败RTX 3090,而推理模型因隐藏的推理内容看起来慢约5倍。
在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难
作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。
Qwen 35B-A3B 在 12GB 显存下非常可用。
一位用户在12GB的RTX 3060上对Qwen 35B-A3B(一个35B参数的MoE模型)进行了基准测试,发现12GB显存是运行该模型并支持32k上下文时的实用甜点区,生成速度可达约47 token/秒。