performance-benchmarking

标签

Cards List
#performance-benchmarking

GPT-6 与 Opus 5.5 的最大革命并非性能,而是速度和成本。

Reddit r/singularity · 21小时前

GPT-6 Sol 和 Claude Opus 5.5 以远低于前代产品的成本和时间实现了接近前沿的性能,突显了显著的效率提升。

0 人收藏 0 人点赞
#performance-benchmarking

次正规浮点数在Intel处理器上开销巨大…

Lobsters Hottest · 2026-09-15 缓存

本文基准测试了Intel、AMD和ARM处理器上次正规浮点数的性能,显示Intel处理器在使用次正规数时出现显著减速,而AMD和ARM则不受影响。

0 人收藏 0 人点赞
#performance-benchmarking

exllamav3 在我的配置下轻松击败运行 CPU 卸载 Qwen-3.8-Flash-Next 的 llama.cpp!

Reddit r/LocalLLaMA · 2026-09-07

一位用户对 exllamav3 和 llama.cpp 进行了 CPU 卸载推理的基准测试,显示 exllamav3 对于 Qwen 模型更快,但对于其他模型更慢,具体取决于硬件和模型架构。

0 人收藏 0 人点赞
#performance-benchmarking

问题:为什么 vLLM 的预填充速度远超其他推理引擎?

Reddit r/LocalLLaMA · 2026-09-01

用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。

0 人收藏 0 人点赞
#performance-benchmarking

FlashMLA sm_120 内核构建,性能比 SDPA 提升 2-3 倍

Reddit r/LocalLLaMA · 2026-08-30

作者为消费级 Blackwell sm_120 构建了 FlashMLA,在长上下文训练和稀疏预填充等注意力密集型工作负载中,性能比 PyTorch SDPA 提升了 2-3 倍。

0 人收藏 0 人点赞
#performance-benchmarking

在128GB内存与约60GB显存(PCIe配置较弱)环境下运行DeepSeek-V4-Flash-0731 q4+量化版本的三次实验:实现可接受的生成速度和提示处理速度

Reddit r/LocalLLaMA · 2026-08-22

作者在配备128GB内存的系统上实验运行DeepSeek-V4-Flash-0731的4位量化模型,通过内存锁定和提示处理策略等优化手段,达到了可接受的推理速度。

0 人收藏 0 人点赞
#performance-benchmarking

全新Google Gemma 4 12B自称性能接近26B模型——我们实测了这两款!

Reddit r/LocalLLaMA · 2026-06-03

Google全新Gemma 4 12B模型宣称性能接近26B模型。在RTX 4090的本地测试中,26B-A4B模型更快且表现更佳,但12B模型显存占用更少,适合笔记本电脑使用。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈