标签
本文详细测试了Ling-3.0-tiny模型在Apple M5芯片Mac上的本地部署与性能,展示了在无独立显卡时以47 token/s的速度运行7.9B参数模型的可行性。
本文介绍了一个用于评估本地LLM配置的基准测试工具,重点关注显存使用情况、性能指标和硬件优化,以协助开发者优化配置。
一位用户分享了测试结果,表明在Qwen 3.8 27B模型中,KV缓存类型f16和q8_0并不等价,f16在细节和一致性上表现更好,并提供了AMD ROCm硬件的配置详情。
用户测试了使用Qwen 27B模型扩展本地AI代理,发现由于内存带宽限制,添加更多代理仅能将吞吐量提高到一定程度,且长提示从并行中获益更多。
作者在MacBook Pro M3Max上使用QWEN 3.8 27B 4bit模型进行了两个本地代理并行运行的实验,发现批处理可以实现并发执行,但会增加延迟,最佳代理数约为4个。
Daniel Stenberg 宣布为 curl 推出新的性能测试套件,自动化构建和结果公开发布在 curl.se/perf。
Primate Labs 发布了 Geekbench 7,新增了视频/音频编码测试、重新设计的多核测试以及更大的数据集,以更准确地评估现代硬件性能。
一位用户在较老的 X99 主板上对 AMD MI50 GPU 在不同 PCIe 配置下进行基准测试,比较了直接 PCIe 连接与使用 PEX8749 交换机的情况。结果显示性能差异极小,令牌生成速度略有提升。
描述了使用 Moby Dick 的全文对待办事项列表和生产力应用进行性能测试,并提供了不同应用格式的测试文件。
对新的SPEC CPU2026基准测试套件进行了深度评估,该套件取代了SPEC CPU2017,包含52个工作负载和一个更慢的参考系统(Ampere eMAG 8180),展示了现代CPU之间的性能对比。
作者介绍了一款基于 Web 的脚本,旨在通过模拟文本、代码和推理生成的速率,帮助用户直观理解本地大语言模型(LLM)部署中的每秒 token 数(tokens per second)性能。
一位开发者在 RTX 4080 上用 OpenCode 对多款自托管 LLM(Qwen 3.5/3.6、Gemma 4、Nemotron 3、GLM-4.7)进行两项编码任务基准测试,揭示了速度与质量的权衡。