club-5060ti 更新:测试过的 RTX 5060 Ti 预设、高上下文测试环境与 Qwen3.8 27B

Reddit r/LocalLLaMA 工具

摘要

RTX 5060 Ti 本地大语言模型仓库已更新,包含经过测试、可复制的预设和一个新的高上下文测试环境,为 Qwen3.8 27B 等模型在单 GPU 和双 GPU 设置上提供已验证的配置和基准测试结果。

关于 RTX 5060 Ti 本地大语言模型仓库的快速更新。自上次发布以来,它已经有了很大变化。项目最初是一系列实用笔记和基准测试结果的集合。这很有用,但随着数据集的增长,它变得难以回答大多数人实际提出的问题:我应该运行什么配置?我已围绕经过测试、可复制的预设重建了仓库,而不是将每个成功的基准测试请求都视为首页结果。发生了什么变化?项目现在分离了三件事: • 预设:供人们复制和运行的精确配置。 • 证据包:经审核的上下文适配、检索、持续生成和性能的证明。 • 原始记录:重试、失败实验和诊断运行,作为工程材料单独保存,不会自动成为推荐。 网站现在以发布的预设目录为首页。更大的结果浏览器仍然存在,用于比较和历史数据,但它不再是访客首先需要解读的内容。 目前有七个发布的预设,跨越 1× 和 2× RTX 5060 Ti 通道: 1× RTX 5060 Ti 16GB • Qwen3.8 27B IQ3_XXS at 64K with q8 KV and built-in MTP • ThinkingCap Qwen3.6 27B IQ3_M at 64K • Nail 35B-A3B IQ3_XXS on a configured 131K route 2× RTX 5060 Ti 16GB • Qwen3.8 27B Q6_K at 131K • ThinkingCap Qwen3.6 27B Q6_K at 131K • Nail 35B-A3B Q4_K_XL at 131K • Muse Glimmer 30B dynamic Q4 at 131K with DFlash 1× 和 2× 通道是我可以在本地测试的,并非项目的天花板。数据模型和贡献路径仍然支持 3×/4× 设置、混合 GPU 和其他 CUDA 硬件,前提是清晰报告拓扑和服务配置。 新的高上下文测试环境:仅仅拥有大的配置上下文大小并不足以称为预设已验证。新的环境校准提示以匹配模型的实际分词器,禁用提示缓存,为每个请求分配唯一的 nonce,并重复执行: • 在测试的上下文层级附近进行长上下文检索; • 必须产生足够工作量并达到客户端可见答案的持续生成。 失败的层级和不完整的运行会被记录,而不是静默地转化为推荐。脚本可以生成候选报告,但不能自动分配推荐状态或发布。这已经发现了一些情况,其中模型技术上在大上下文下加载,但要么检索失败,要么在隐藏推理中停止,要么无法可靠地产生可见输出。 Qwen3.8 27B 结果:当前推荐的单卡路径是: • IQ3_XXS • 64K 上下文 • q8 KV • 内置 MTP, n=2 • 在 45.9K token 提示下,持续解码约 29.8 tok/s • 通过两次未缓存检索和两次持续可见答案检查 对于双卡,Qwen3.8 27B Q6_K 现在是推荐的密集路径: • 131,072 上下文 • f16 KV • 50/50 张量分割 • 内置 MTP, n=2 • 在约 115.4K 提示 token 下通过两次检索检查 • 在约 91.8K 提示 token 下通过两次持续检查 • 两次持续运行生成了 3,072 token 并达到了可见答案 • 预填充约 597.9 tok/s • 持续解码约 38.6 tok/s 测试环境最初为思考模型分配了 1,536 token 的输出额度。Qwen3.8 可能将大部分预算用于推理而未达到可见答案,因此现在该额度与最小生成工作量要求分开。这给了重度思考模型更多空间来完成,而不削弱实际通过阈值。131K 结果是该预设测试的最高层级,并非声称模型的绝对最大上下文。 测量注意事项:种子结果是在两个 GPU 核心时钟锁定在 2300 MHz 和原装 180W 功率限制下测量的。这是我通常的更安静操作点,使运行更可重现,但原装超频或超频卡可能更快。 仓库:https://github.com/5p00kyy/club-5060ti 预设目录和证据浏览器:https://5p00kyy.github.io/club-5060ti/ 欢迎贡献,包括复现、失败的适配检查、混合 GPU 设置和更大的 5060 Ti 配置。无聊的细节很重要:精确模型、量化、上下文、KV 缓存、运行时、拓扑、提示长度、生成 token 和服务标志。
查看原文

相似文章

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。

2 x 5070ti Qwen 27B 完整配置/统计

Reddit r/LocalLLaMA

技术帖分享了在 2x RTX 5070 Ti GPU 上使用 vLLM cu129-nightly 运行 Qwen 27B 的性能数据,解码速度最高可达 94-87 tps,GPU KV 缓存达 170k。