标签
LWN的一条评论讨论了C语言编译器中尾调用优化相对较新的实现,引用了历史上的局限性,并指出现代的GCC和Clang现已支持该优化,这对解释器实现有潜在好处。
The article explains how to speed up running Haskell scripts with Magix on GitHub Actions by caching dependencies and compiled artifacts, reducing full build times from over 100 seconds to near-instant reruns.
Daniel Lemire 对 Go 中的性能剖析引导优化(PGO)进行了基准测试,显示在解析 JSON 时速度提升约为 2-5%,当训练 profile 与工作负载匹配时效果最佳。
一篇技术文章解释了垃圾回收的真实性能成本,对比了 Go、Java、Rust、Swift 和 Python 等语言中的跟踪式 GC、引用计数和编译期内存管理。
Windows 11 内置的天气应用可能占用超过 1 GB 内存,约为 macOS 天气应用的五倍,原因是其基于 WebView2 的非原生架构。这可能会对配备 8-16 GB 内存的低端 PC 产生明显影响。
httptap 是一个 Python CLI,可将 HTTP 请求剖析为 DNS、TCP、TLS 和数据传输等阶段,生成详细的瀑布时间线,用于故障排查和性能分析。
通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。
Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。
一条推文强调了RTX PRO 6000(1.8TB/s)和DGX Spark(273GB/s)之间的巨大带宽差异,认为对于本地AI代理和代理集群来说,更高的带宽至关重要。
一个名为 KISS Sorcar 的 AI 智能体在不到 8 小时内、花费不到 150 美元,在 SQLite 的四个基准测试上实现了经验证的 1.59 倍几何平均加速,并通过了超过 100 万项 SQLite 测试。这凸显了编码智能体不断增强的能力。
Ahmad Osman 分享了在 NVIDIA DGX Station 上运行 DeepSeek V4 Flash 0731 的性能数据。
llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
PlanetScale 的一篇工程博客分析了由长事务和高并发导致的 MySQL 宕机,解释了并行性如何降低吞吐量,以及 Vitess 的事务池如何处理(并放大)了该问题。
Assembly Hall of Shame 是一个 GitHub 项目,通过利用 MMIO 延迟和微码辅助等硬件怪癖,对最慢的单个 x86 指令进行排名,实现了如 62 秒 fxrstor64 这样的极端延迟。
RPCS3 的 ARM 移植版现在运行速度快了 60%,功耗降低了 25%,这是因为修复了一个忙等待定时器 bug、用 ARM ISB 替换了 x86 pause,并重写了 LLVM 代码生成。这些改进源于由一台廉价 Android 掌上测试设备推动的低层 ARM 优化。
llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。
Guillermo Rauch 打趣说,Next.js 是 SPA 的 Next.js,并强调 Next.js 16.3 在 v0 中使导航速度提升了约 3.5 倍,这得益于 Agent 驱动的优化循环。
一位软件工程师反思科学家往往缺乏软件工程技能,以优化天体物理学模拟后处理工具为例,倡导为科学家开设一门类似“Missing Semester”的课程。
一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。