performance-optimization

标签

Cards List
#performance-optimization

@MaximeRivest: DSPy 3.4 候选版本已发布,我们正从 litellm 迁移。我一直困扰于 dspy 导入速度慢以及……

X AI KOLs Following ↗ · 2026-09-11 缓存

DSPy 3.4 候选版本已宣布,正从 litellm 迁移以提升导入速度并减少依赖。社区成员如 Drew Breunig 对改进表示赞赏。

0 人收藏 0 人点赞
#performance-optimization

从苹果神经引擎中恢复 50 GB/S 的性能

Hacker News Top ↗ · 2026-09-10 缓存

在苹果 M3 神经引擎中,当权重大小为 1 MiB 的倍数时,发现了性能节流问题,导致吞吐量下降。通过避开有问题的 DMA 路径,Llama 3.2 和 Qwen3-8B 等模型的 token 吞吐量得到了显著改善。

0 人收藏 0 人点赞
#performance-optimization

@ashxhart: 一直在给我的 M3 Ultra Studio 精心调校,并摆弄 MLX。下午开始时速度为 42 tok/s。现在:73 tok/s,而且…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一位作者改进了 M3 Ultra Studio 上的 MLX 性能,使 4 位量化的 Qwen3.8-Flash-Next 模型达到 73 tok/s,其智能评分与 GPT-5.6 Sol 相当,凸显了本地 AI 日益增长的潜力。

0 人收藏 0 人点赞
#performance-optimization

ukisai/Swift-Qwen3.8-27b

Hugging Face Models Trending ↗ · 2026-09-08 缓存

Swift-Qwen3.8-27B 是 UkisAI 基于 Qwen3.8-27B 开发的推理高效版本,可将思考令牌减少 58.3%,同时保持几乎相同的性能。

0 人收藏 0 人点赞
#performance-optimization

@_DivyaMakkar: 花了一些时间用纯 JAX 与 @AdityaMakkar0 一起创建了一个轻量级、高性能的异步 RL 堆栈!我们分享了一份工作日志 …

X AI KOLs Following ↗ · 2026-09-07

作者们用纯 JAX 创建了一个轻量级、高性能的异步强化学习堆栈,分享了一份关于推理、RDMA 权重传输、内存优化以及用于扩展 RL 系统的分片的见解的工作日志。

0 人收藏 0 人点赞
#performance-optimization

每个内核程序员都应该知道的 Jump Labels

Lobsters Hottest ↗ · 2026-09-07 缓存

本文提供了关于 Linux 内核中 Jump Labels 的全面指南,解释了其硬件背景、用法和实现细节,面向内核程序员。

0 人收藏 0 人点赞
#performance-optimization

Debian Code Search:基于 Go SIMD 的高性能 TurboPFor

Lobsters Hottest ↗ · 2026-09-06 缓存

Michael Stapelberg 详细介绍了他是如何移除 Debian Code Search 最后一个 cgo 依赖的:他利用 Go 新引入的 SIMD 支持重新实现了 TurboPFor 整数编解码器,并借助 AVX512 超越了参考实现的性能。

0 人收藏 0 人点赞
#performance-optimization

Qwen3.8-Flash-Next MTP 集成至 ik_llama.cpp(集成头或单独 -md 文件)... 在 5090 + 128GB 上 45 → 90 tok/s,甚至可在 12GB 4070 上运行

Reddit r/LocalLLaMA ↗ · 2026-09-03

文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。

0 人收藏 0 人点赞
#performance-optimization

@seclink:我们发现将模型蒸馏到一个架构高度相似的目标模型,其性能远超…

X AI KOLs Following ↗ · 2026-09-01 缓存

研究表明,将AI模型蒸馏到与教师模型相似的架构中,相比蒸馏到差异很大的架构,能获得更好的性能。

0 人收藏 0 人点赞
#performance-optimization

我是如何在一周内让Rustdoc快33%的

Lobsters Hottest ↗ · 2026-08-28 缓存

一位Rustdoc团队成员通过一系列优化和错误修复,在Rustdoc中实现了33%的性能提升,解决了影响文档生成的递归限制问题。

0 人收藏 0 人点赞
#performance-optimization

@RespanAI: 多数AI产品并不会彻底失败。它们只是在各处都损失了一点性能。我们为整个循环构建了Respan,并且……

X AI KOLs Following ↗ · 2026-08-27 缓存

RespanAI推出Respan,专为应对AI产品性能退化循环而设计,并附有一部宣传影片。

0 人收藏 0 人点赞
#performance-optimization

CPU 中的内存排序

Lobsters Hottest ↗ · 2026-08-26 缓存

本文解释了CPU乐观地实现内存排序,并依赖回滚机制来处理竞争,同时澄清了关于强排序与弱排序架构的常见误解。

0 人收藏 0 人点赞
#performance-optimization

mold: 大规模并行链接器

Lobsters Hottest ↗ · 2026-08-26 缓存

mold 是一个大规模并行链接器,通过在所有阶段应用数据并行性来减少链接时间,实现了比最先进的链接器如 lld 快 2.4 到 16.1 倍的性能。

0 人收藏 0 人点赞
#performance-optimization

解决 1+N 查询问题

Lobsters Hottest ↗ · 2026-08-25

讨论了 1+N 查询问题的解决方案,这是数据库交互中常见的性能问题,通常与 ORM 使用有关。

0 人收藏 0 人点赞
#performance-optimization

修复Ornith1.5 35B A3B的MTP头。+3% TPS -33% 实际时间

Reddit r/LocalLLaMA ↗ · 2026-08-22

一位用户修复了Ornith1.5 35B A3B模型的MTP头,使任务的实际时间减少了33%,显著加快了本地HAM无线电应用的速度。

0 人收藏 0 人点赞
#performance-optimization

如果你在好奇为什么Ornith 1.5 35B A3B MTP版本如此缓慢,原因在这里

Reddit r/LocalLLaMA ↗ · 2026-08-20 缓存

Ornith 1.5 35B A3B模型的MTP张量似乎未被初始化,导致推测解码性能不佳。通过从Qwen3.6-35B-A3B移植训练好的头部,速度提升了29%。

0 人收藏 0 人点赞
#performance-optimization

20倍的CI流量而不变慢:我们如何在Datadog重建Git服务

Lobsters Hottest ↗ · 2026-08-20 缓存

Datadog使用名为gitretriever的自定义镜像重建了他们的Git服务基础设施,处理了20倍的CI流量,同时保持了低延迟并减少了CPU使用率。

0 人收藏 0 人点赞
#performance-optimization

利用 PyTorch 原生栈在服务器 CPU 上高效进行小型 NLP 模型的 INT8 推理

arXiv cs.CL ↗ · 2026-08-20 缓存

本文将 SmoothQuant 集成到 PyTorch 的原生栈中,以在 Intel Xeon CPU 上高效进行小型 NLP 模型的 INT8 推理,实现了高达 5.8 倍的加速,且精度损失可忽略不计。

0 人收藏 0 人点赞
#performance-optimization

不要忽略旧硬件上的llama.cpp RPC。5070 Ti和1080 Ti通过千兆以太网的测试结果:实际上功能可用。

Reddit r/LocalLLaMA ↗ · 2026-08-18

本文介绍了使用llama.cpp通过RPC在5070 Ti和1080 Ti GPU上运行AI模型的性能结果和优化技巧,重点讨论了预填充与token生成速度之间的权衡。

0 人收藏 0 人点赞
#performance-optimization

Linux 7.3 在 VRAM 不足时提升性能

Hacker News Top ↗ · 2026-08-18 缓存

Linux 7.3 合并了改进 VRAM 管理的内核补丁,通过优化内存淘汰和缓存机制,在物理 VRAM 不足时增强了游戏性能稳定性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈