计划花费约100美元对Qwen3.8-27B的不同量化版本和KV缓存进行基准测试,并在开始前寻求意见

Reddit r/LocalLLaMA 新闻

摘要

作者计划花费100美元使用云GPU对Qwen3.8-27B模型进行基准测试,包括不同的量化级别和KV缓存设置,重点关注编码和智能体任务,为本地AI爱好者提供有用数据,并寻求社区对测试方法的意见。

简而言之:我计划花费约100美元使用云GPU对Qwen3.8-27B进行基准测试,重点关注本地运行时实际重要的问题:不同的量化级别/提供商、8位与16位KV缓存、GGUF与EXL3、上下文长度权衡,以及在编码/智能体工作负载上的令牌效率。我的主要目标是我自己的36GB配置(3090 + 3060 12GB),但我也希望结果对24GB和48GB用户有用。在我开始消耗GPU时间之前,我想对测试矩阵、基准测试、方法论以及我可能遗漏的重要事项获取反馈。以下是我目前想法的详细信息。现在100美元可能不够,但我会从这个预算开始,看看能坚持多久,并希望社区能帮助和建议如何最好地利用它来获取最有用的数据。我需要社区的帮助,因为我知道以我的ADHD,很容易将这个项目变成浪费100美元而得不到任何有用的东西。我这样做是因为最近看到很多关于Qwen3.8-27B量化和KV缓存的讨论和声称,但我发现的大多数比较要么是基于感觉,要么是KLD,这些并不能真正回答我在决定本地运行什么时所关心的问题。我想回答的一些问题包括:更高的量化加8位KV是否比更低的量化加16位KV更好?是否应该牺牲KV精度来获得显著更多的上下文并避免任务中途压缩?Q6、Q5、Q4在长编码/智能体任务中相比全精度实际损失多少?不同的GGUF量化提供商是否产生有意义的实际差异?还是仅仅是PPL和KLD数字?GGUF/llama.cpp与EXL3在大致相同内存使用下对比如何?更低量化只是得分略低,还是也会使用更多令牌/智能体步骤来完成相同任务?(即衡量令牌效率)我将运行每个基准测试案例多次以避免运行间的差异,但如果预算不允许,我将稍微偏向于我的设置。我自己的机器是3090 + 3060 12GB = 36GB VRAM,可以运行Q6级别的量化并支持相当大的上下文(150k到180k),具体取决于量化/提供商/缓存设置。这是我个人最感兴趣的配置层次。我希望结果对社区在三个大致硬件类别下有用:- 24GB:单3090/4090级别 - ~32-36GB:5090、3090 + 3060、双16GB卡等 - 48GB:双3090 / 48GB卡。目前的想法是重点测试Q6,并与全精度参考进行比较,然后如果预算允许再添加Q5/Q4。我还在适当的地方测试8位和16位KV缓存。对于基准测试,我目前考虑Terminal-Bench2.1和DeepSWE,因为我更关心编码和更长的智能体任务,而不是MMLU风格的多项选择测试。我还想记录不仅仅是通过率:我想看到生成的令牌数、智能体/工具使用次数、最大上下文达到、上下文压缩情况。我很好奇某些量化在通过率上看起来几乎相同,但在长任务上令牌效率是否明显降低。特别是考虑到Qwen3.8的扩展思考模式。如你所见,我对速度不感兴趣,而是想看到实际编码和大型代码库任务的质量差异。我的自动化计划基本上是编写一个可以稍加修改重用的脚本,我将启动多个RunPod/Vast等实例,自动构建llama.cpp或TabbyAPI/ExLlamaV3,下载所需的量化,运行基准测试配置,保存所有元数据/结果,然后关闭实例。对于重要比较,我希望每个配置运行多次,而不是信任单次运行。我故意不测试所有可能的量化 × 缓存 × 后端 × 上下文组合,因为那样100美元很快就会用完。我宁愿正确回答较少数量的有用问题。而且我不太确定应该关注什么,但有大致的想法。在开始之前,我真的很感激这里的人提供意见:哪些配置你绝对会包括?Q4/Q5/Q6/Q8——你会如何分配重复次数?有没有特定的GGUF提供商/量化值得比较?(我最感兴趣的是unsloth和bartwski)。有没有更好的智能体/编码基准测试我应该包括,而不是或同时使用Terminal-Bench/DeepSWE?如何正确测试8位KV与16位KV/上下文权衡?有什么我应该记录以便以后有用的?有什么方法论陷阱我应该避免?如果你有24GB、32-36GB或48GB,你最希望这个基准测试回答什么配置问题?完成后我会发布脚本/配置和原始结果,以便人们可以重现或指出我搞错的地方。在开始花费GPU预算之前,非常欢迎建议。
查看原文

相似文章

在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文

Reddit r/LocalLLaMA

用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。