标签
GPT-6 Sol 和 Claude Opus 5.5 以远低于前代产品的成本和时间实现了接近前沿的性能,突显了显著的效率提升。
本文基准测试了Intel、AMD和ARM处理器上次正规浮点数的性能,显示Intel处理器在使用次正规数时出现显著减速,而AMD和ARM则不受影响。
一位用户对 exllamav3 和 llama.cpp 进行了 CPU 卸载推理的基准测试,显示 exllamav3 对于 Qwen 模型更快,但对于其他模型更慢,具体取决于硬件和模型架构。
用户分享了基准测试结果,显示 vLLM 的预填充性能显著快于 llama.cpp 和其他引擎,并质疑这种速度差异背后的技术原因。
作者为消费级 Blackwell sm_120 构建了 FlashMLA,在长上下文训练和稀疏预填充等注意力密集型工作负载中,性能比 PyTorch SDPA 提升了 2-3 倍。
作者在配备128GB内存的系统上实验运行DeepSeek-V4-Flash-0731的4位量化模型,通过内存锁定和提示处理策略等优化手段,达到了可接受的推理速度。
Google全新Gemma 4 12B模型宣称性能接近26B模型。在RTX 4090的本地测试中,26B-A4B模型更快且表现更佳,但12B模型显存占用更少,适合笔记本电脑使用。