标签
fearless_simd v0.7 新增了 64 位整数支持、SSE2 级别、改进的泛型及更多操作,v1.0 即将发布。
This technical blog post explains the performance impact of memory alignment in SIMD vectorization, covering architectures with strict alignment requirements, cacheline crossing, and the behavior of modern CPUs.
一位用户报告称,在 Llama-CPP 中使用并行子代理时,解码性能很好,但单个代理的 prefill(例如处理网络搜索)会使所有其他代理停滞不前,并请求调优建议。
QuixiAI 报告称,使用 SlimServe 在 4x A100 上运行 DeepSeek v4 Flash 0731,单请求达到 175 tok/s,64 并发请求达到 1k tok/s。
一篇技术博客文章,解释了如何使用浮点除法和融合乘加来执行整数除法和取余,并给出了操作数位宽的限制,同时讨论了SIMD和舍入模式的实际注意事项。
在 RTX 5090 上对 unsloth 的 Muse Glimmer 30B 进行基准测试,采用推测解码,使用 DFlash 草稿模型和基于 GPU 的 argmax PR,最高可达 253 t/s,不过该 PR 仍是草稿状态。
据报道,Glimmer在RTX 5090上使用Dflash达到了233.4 tps,256k上下文可装进24GB显存,令用户兴奋不已。
Klaus Post 讨论了在 Go 压缩库中重新平衡 deflate 压缩级别的过程,以使速度/压缩的权衡更加线性和直观。
nuskey8 发布了 lkv,这是一个用 Rust 编写的轻量级嵌入式键值存储,针对点查找进行了优化,声称比 SQLite 快约 165 倍,比 LMDB 快约 15 倍,且功能集极简。
LWN的一条评论讨论了C语言编译器中尾调用优化相对较新的实现,引用了历史上的局限性,并指出现代的GCC和Clang现已支持该优化,这对解释器实现有潜在好处。
The article explains how to speed up running Haskell scripts with Magix on GitHub Actions by caching dependencies and compiled artifacts, reducing full build times from over 100 seconds to near-instant reruns.
Daniel Lemire 对 Go 中的性能剖析引导优化(PGO)进行了基准测试,显示在解析 JSON 时速度提升约为 2-5%,当训练 profile 与工作负载匹配时效果最佳。
Windows 11 内置的天气应用可能占用超过 1 GB 内存,约为 macOS 天气应用的五倍,原因是其基于 WebView2 的非原生架构。这可能会对配备 8-16 GB 内存的低端 PC 产生明显影响。
httptap 是一个 Python CLI,可将 HTTP 请求剖析为 DNS、TCP、TLS 和数据传输等阶段,生成详细的瀑布时间线,用于故障排查和性能分析。
通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。
Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。
一条推文强调了RTX PRO 6000(1.8TB/s)和DGX Spark(273GB/s)之间的巨大带宽差异,认为对于本地AI代理和代理集群来说,更高的带宽至关重要。
一个名为 KISS Sorcar 的 AI 智能体在不到 8 小时内、花费不到 150 美元,在 SQLite 的四个基准测试上实现了经验证的 1.59 倍几何平均加速,并通过了超过 100 万项 SQLite 测试。这凸显了编码智能体不断增强的能力。
Ahmad Osman 分享了在 NVIDIA DGX Station 上运行 DeepSeek V4 Flash 0731 的性能数据。
llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。