performance-optimization

标签

Cards List
#performance-optimization

每个内核程序员都应该知道的 Jump Labels

Lobsters Hottest ↗ · 2026-09-07 缓存

本文提供了关于 Linux 内核中 Jump Labels 的全面指南,解释了其硬件背景、用法和实现细节,面向内核程序员。

0 人收藏 0 人点赞
#performance-optimization

Debian Code Search:基于 Go SIMD 的高性能 TurboPFor

Lobsters Hottest ↗ · 2026-09-06 缓存

Michael Stapelberg 详细介绍了他是如何移除 Debian Code Search 最后一个 cgo 依赖的:他利用 Go 新引入的 SIMD 支持重新实现了 TurboPFor 整数编解码器,并借助 AVX512 超越了参考实现的性能。

0 人收藏 0 人点赞
#performance-optimization

Qwen3.8-Flash-Next MTP 集成至 ik_llama.cpp(集成头或单独 -md 文件)... 在 5090 + 128GB 上 45 → 90 tok/s,甚至可在 12GB 4070 上运行

Reddit r/LocalLLaMA ↗ · 2026-09-03

文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。

0 人收藏 0 人点赞
#performance-optimization

@seclink:我们发现将模型蒸馏到一个架构高度相似的目标模型,其性能远超…

X AI KOLs Following ↗ · 2026-09-01 缓存

研究表明,将AI模型蒸馏到与教师模型相似的架构中,相比蒸馏到差异很大的架构,能获得更好的性能。

0 人收藏 0 人点赞
#performance-optimization

我是如何在一周内让Rustdoc快33%的

Lobsters Hottest ↗ · 2026-08-28 缓存

一位Rustdoc团队成员通过一系列优化和错误修复,在Rustdoc中实现了33%的性能提升,解决了影响文档生成的递归限制问题。

0 人收藏 0 人点赞
#performance-optimization

@RespanAI: 多数AI产品并不会彻底失败。它们只是在各处都损失了一点性能。我们为整个循环构建了Respan,并且……

X AI KOLs Following ↗ · 2026-08-27 缓存

RespanAI推出Respan,专为应对AI产品性能退化循环而设计,并附有一部宣传影片。

0 人收藏 0 人点赞
#performance-optimization

CPU 中的内存排序

Lobsters Hottest ↗ · 2026-08-26 缓存

本文解释了CPU乐观地实现内存排序,并依赖回滚机制来处理竞争,同时澄清了关于强排序与弱排序架构的常见误解。

0 人收藏 0 人点赞
#performance-optimization

mold: 大规模并行链接器

Lobsters Hottest ↗ · 2026-08-26 缓存

mold 是一个大规模并行链接器,通过在所有阶段应用数据并行性来减少链接时间,实现了比最先进的链接器如 lld 快 2.4 到 16.1 倍的性能。

0 人收藏 0 人点赞
#performance-optimization

解决 1+N 查询问题

Lobsters Hottest ↗ · 2026-08-25

讨论了 1+N 查询问题的解决方案,这是数据库交互中常见的性能问题,通常与 ORM 使用有关。

0 人收藏 0 人点赞
#performance-optimization

修复Ornith1.5 35B A3B的MTP头。+3% TPS -33% 实际时间

Reddit r/LocalLLaMA ↗ · 2026-08-22

一位用户修复了Ornith1.5 35B A3B模型的MTP头,使任务的实际时间减少了33%,显著加快了本地HAM无线电应用的速度。

0 人收藏 0 人点赞
#performance-optimization

如果你在好奇为什么Ornith 1.5 35B A3B MTP版本如此缓慢,原因在这里

Reddit r/LocalLLaMA ↗ · 2026-08-20 缓存

Ornith 1.5 35B A3B模型的MTP张量似乎未被初始化,导致推测解码性能不佳。通过从Qwen3.6-35B-A3B移植训练好的头部,速度提升了29%。

0 人收藏 0 人点赞
#performance-optimization

20倍的CI流量而不变慢:我们如何在Datadog重建Git服务

Lobsters Hottest ↗ · 2026-08-20 缓存

Datadog使用名为gitretriever的自定义镜像重建了他们的Git服务基础设施,处理了20倍的CI流量,同时保持了低延迟并减少了CPU使用率。

0 人收藏 0 人点赞
#performance-optimization

利用 PyTorch 原生栈在服务器 CPU 上高效进行小型 NLP 模型的 INT8 推理

arXiv cs.CL ↗ · 2026-08-20 缓存

本文将 SmoothQuant 集成到 PyTorch 的原生栈中,以在 Intel Xeon CPU 上高效进行小型 NLP 模型的 INT8 推理,实现了高达 5.8 倍的加速,且精度损失可忽略不计。

0 人收藏 0 人点赞
#performance-optimization

不要忽略旧硬件上的llama.cpp RPC。5070 Ti和1080 Ti通过千兆以太网的测试结果:实际上功能可用。

Reddit r/LocalLLaMA ↗ · 2026-08-18

本文介绍了使用llama.cpp通过RPC在5070 Ti和1080 Ti GPU上运行AI模型的性能结果和优化技巧,重点讨论了预填充与token生成速度之间的权衡。

0 人收藏 0 人点赞
#performance-optimization

Linux 7.3 在 VRAM 不足时提升性能

Hacker News Top ↗ · 2026-08-18 缓存

Linux 7.3 合并了改进 VRAM 管理的内核补丁,通过优化内存淘汰和缓存机制,在物理 VRAM 不足时增强了游戏性能稳定性。

0 人收藏 0 人点赞
#performance-optimization

Llama.cpp v0.1.0

Hacker News Top ↗ · 2026-08-17 缓存

Llama.cpp v0.1.0 是用于高效 LLM 和 VLM 推理的 C/C++ 实现,支持广泛的硬件,配置简单且性能卓越。

0 人收藏 0 人点赞
#performance-optimization

Qwen3.8-27B 在 Apple Silicon 上借助 mlx-dspark 速度提升至约3倍

Reddit r/LocalLLaMA ↗ · 2026-08-14

mlx-dspark v0.10.0 新增了对 Apple Silicon 上 Qwen3.8-27B 的支持,通过无损验证的推测解码提供高达3倍的速度提升。

0 人收藏 0 人点赞
#performance-optimization

NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进

Reddit r/LocalLLaMA ↗ · 2026-08-14

NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。

0 人收藏 0 人点赞
#performance-optimization

@PyTorch: AMD has been upstreaming optimizations for improved FP8 training support in PyTorch/TorchTitan and PyTorch/TorchAO, mak…

X AI KOLs Timeline ↗ · 2026-08-13 缓存

AMD upstreamed optimizations to PyTorch/TorchTitan and TorchAO for FP8 training on AMD Instinct GPUs, achieving up to 13.4% throughput gains on Llama3-8B and recovering 89% of FP8 quantization overhead on DeepSeek-V3 via fused Triton kernels.

0 人收藏 0 人点赞
#performance-optimization

@omarsar0: TokTier makes tokenization stateful for agentic serving. Across 153,951 real agent calls with a 94.1% prompt-cache hit …

X AI KOLs Following ↗ · 2026-08-03 缓存

TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈