标签
llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。
一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。
PlanetScale 的一篇工程博客分析了由长事务和高并发导致的 MySQL 宕机,解释了并行性如何降低吞吐量,以及 Vitess 的事务池如何处理(并放大)了该问题。
Assembly Hall of Shame 是一个 GitHub 项目,通过利用 MMIO 延迟和微码辅助等硬件怪癖,对最慢的单个 x86 指令进行排名,实现了如 62 秒 fxrstor64 这样的极端延迟。
RPCS3 的 ARM 移植版现在运行速度快了 60%,功耗降低了 25%,这是因为修复了一个忙等待定时器 bug、用 ARM ISB 替换了 x86 pause,并重写了 LLVM 代码生成。这些改进源于由一台廉价 Android 掌上测试设备推动的低层 ARM 优化。
llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。
Guillermo Rauch 打趣说,Next.js 是 SPA 的 Next.js,并强调 Next.js 16.3 在 v0 中使导航速度提升了约 3.5 倍,这得益于 Agent 驱动的优化循环。
一位软件工程师反思科学家往往缺乏软件工程技能,以优化天体物理学模拟后处理工具为例,倡导为科学家开设一门类似“Missing Semester”的课程。
一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。
pgrust 0.2 rebuilds the Postgres query engine with batching, operator fusion, and SIMD, achieving 300x faster analytical queries and 30% faster OLTP than Postgres.
Prime Bun 是 Prime Agent 的一个 Bun 原生分支,用 JavaScript/TypeScript 运行时取代了 Python 笔记本,大幅降低了长时间运行编程任务的延迟。
伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。
This article explains why PostgreSQL disables parallel query for count(DISTINCT) aggregates, causing full-table sorts and disk spills, and compares it to the parallel-friendly count(*).
作者将vLLM的服务栈移植到C++20,生成一个66 MiB的二进制文件,推理时无Python,可逐token与vLLM核对,且在测试硬件上吞吐量具竞争力。
有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。
一篇深度博文,通过基准测试复现和代码分析,解读 GreptimeDB 中让 Prometheus 读取转换速度提升 10 倍的 Rust 性能 PR。
本文探讨了 LuaJIT 的一个陷阱:诸如 unpack 之类的未实现(NYI)操作会悄然导致 trace 黑名单化,从而使基准测试性能降低 20 倍,并提供了在 CI 中防范此类问题的方法。
BetterBench 是一款新的基准测试工具,通过确保内容一致性在 1% 以内,并在不同内容类型上进行测试,提供更准确的 PP 和 TPS 测量,从而解决 LLM 性能基准测试中的变异性问题。