performance

标签

Cards List
#performance

我受够了我那300GB模型在RPC上加载要5分钟。PR 26291 将其加速300%,降至1分30秒(4060ti+ddr4)+(4060ti+ddr5)

Reddit r/LocalLLaMA · 5天前

llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。

0 人收藏 0 人点赞
#performance

Qwen 3.6 27B 在 llama.cpp 中的标志/设置

Reddit r/LocalLLaMA · 5天前

一位用户分享了他们在 RTX 5090 上运行 Qwen 3.6 27B 的 llama.cpp 服务器配置,达到了 80-100 t/s 的速度,并向社区询问其他设置和技巧。

0 人收藏 0 人点赞
#performance

并发 vs. 吞吐量:为什么更多并行性反而会让数据库变慢

Lobsters Hottest · 5天前 缓存

PlanetScale 的一篇工程博客分析了由长事务和高并发导致的 MySQL 宕机,解释了并行性如何降低吞吐量,以及 Vitess 的事务池如何处理(并放大)了该问题。

0 人收藏 0 人点赞
#performance

Assembly Hall of Shame

Hacker News Top · 5天前 缓存

Assembly Hall of Shame 是一个 GitHub 项目,通过利用 MMIO 延迟和微码辅助等硬件怪癖,对最慢的单个 x86 指令进行排名,实现了如 62 秒 fxrstor64 这样的极端延迟。

0 人收藏 0 人点赞
#performance

PS3 模拟现在在 ARM 上运行很快

Lobsters Hottest · 5天前 缓存

RPCS3 的 ARM 移植版现在运行速度快了 60%,功耗降低了 25%,这是因为修复了一个忙等待定时器 bug、用 ARM ISB 替换了 x86 pause,并重写了 LLVM 代码生成。这些改进源于由一台廉价 Android 掌上测试设备推动的低层 ARM 优化。

0 人收藏 0 人点赞
#performance

llama.cpp PR 报告:仅切换一个 SYCL 内核,Intel Battlemage 上量化 KV 解码在 118K 上下文最高提速 169%

Reddit r/LocalLLaMA · 5天前

llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。

0 人收藏 0 人点赞
#performance

@rauchg:Next.js 是 SPA 的 Next.js

X AI KOLs Timeline · 5天前 缓存

Guillermo Rauch 打趣说,Next.js 是 SPA 的 Next.js,并强调 Next.js 16.3 在 v0 中使导航速度提升了约 3.5 倍,这得益于 Agent 驱动的优化循环。

0 人收藏 0 人点赞
#performance

科学领域的软件理解确实参差不齐

Lobsters Hottest · 6天前 缓存

一位软件工程师反思科学家往往缺乏软件工程技能,以优化天体物理学模拟后处理工具为例,倡导为科学家开设一门类似“Missing Semester”的课程。

0 人收藏 0 人点赞
#performance

一个 llama.cpp PR 让 Q2_0 在 x86 CPU 上提速 3.0–3.6 倍,8B 解码从 2.39 升至 8.20 tok/s

Reddit r/LocalLLaMA · 6天前

一个 llama.cpp 拉取请求为 Q2_0 × Q8_0 点积添加了 x86 VNNI 实现,在 Bonsai 模型上实现了 3.0–3.6 倍的纯 CPU 加速,内核级逐位精确,且 token 一致性达 99.2%。

0 人收藏 0 人点赞
#performance

Making Postgres 300x faster for analytics: batching, operator fusion, and SIMD

Hacker News Top · 6天前 缓存

pgrust 0.2 rebuilds the Postgres query engine with batching, operator fusion, and SIMD, achieving 300x faster analytical queries and 30% faster OLTP than Postgres.

0 人收藏 0 人点赞
#performance

@sashimikun_void: Prime-Bun: https://github.com/sng-asyncfunc/prime-bun… 一个超快的 Prime Agent 分支,旨在编排并发…

X AI KOLs Following · 6天前 缓存

Prime Bun 是 Prime Agent 的一个 Bun 原生分支,用 JavaScript/TypeScript 运行时取代了 Python 笔记本,大幅降低了长时间运行编程任务的延迟。

0 人收藏 0 人点赞
#performance

@CycleDecoded: 别再用原生 HuggingFace硬扛本地大模型推理了,显存直接爆满,吞吐量慢得像乌龟爬! 伯克利实验室出品的 vLLM,用搞操作系统内存分页(PagedAttention)的那套黑科技,直接把 GPU 显存压榨到了极限,KV Cache…

X AI KOLs Timeline · 6天前 缓存

伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。

0 人收藏 0 人点赞
#performance

The DISTINCT in Your COUNT

Hacker News Top · 6天前 缓存

This article explains why PostgreSQL disables parallel query for count(DISTINCT) aggregates, causing full-table sorts and disk spills, and compares it to the parallel-friendly count(*).

0 人收藏 0 人点赞
#performance

我将vLLM的服务栈移植到C++20:66 MiB二进制,推理时无Python,输出与vLLM逐token核对

Reddit r/LocalLLaMA · 6天前

作者将vLLM的服务栈移植到C++20,生成一个66 MiB的二进制文件,推理时无Python,可逐token与vLLM核对,且在测试硬件上吞吐量具竞争力。

0 人收藏 0 人点赞
#performance

使用 Q4_K MTP 草稿模型与 Gemma 4 31b 解码速度提升 10%

Reddit r/LocalLLaMA · 6天前

有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。

0 人收藏 0 人点赞
#performance

只改一个函数,性能提升10倍?解读一个 Rust 性能 PR

Lobsters Hottest · 2026-08-06 缓存

一篇深度博文,通过基准测试复现和代码分析,解读 GreptimeDB 中让 Prometheus 读取转换速度提升 10 倍的 Rust 性能 PR。

0 人收藏 0 人点赞
#performance

LuaJIT 中的一个 NYI 操作悄然毒害了无关的热循环

Lobsters Hottest · 2026-08-06 缓存

本文探讨了 LuaJIT 的一个陷阱:诸如 unpack 之类的未实现(NYI)操作会悄然导致 trace 黑名单化,从而使基准测试性能降低 20 倍,并提供了在 CI 中防范此类问题的方法。

0 人收藏 0 人点赞
#performance

Bullet

Product Hunt · 2026-08-06

Bullet 是一款在 Product Hunt 上推出的编码工具,声称比 Claude Code 和 Codex 快 30-60%。

0 人收藏 0 人点赞
#performance

收缩 Ruby 哈希

Lobsters Hottest · 2026-08-06 缓存

一篇深入的技术博文,考察 Ruby Hash 的内存使用,与 Struct 进行比较,并探讨哈希收缩的历史实现变更及潜在优化。

0 人收藏 0 人点赞
#performance

Introducing BetterBench - 更准确的 PP 和 TPS 测量

Reddit r/LocalLLaMA · 2026-08-06

BetterBench 是一款新的基准测试工具,通过确保内容一致性在 1% 以内,并在不同内容类型上进行测试,提供更准确的 PP 和 TPS 测量,从而解决 LLM 性能基准测试中的变异性问题。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈