performance-tuning

标签

Cards List
#performance-tuning

NVIDIA Exemplar Cloud:在AI基础设施上释放全部性能的经验教训(12分钟阅读)

TLDR AI · 2天前 缓存

NVIDIA分享了其Exemplar Cloud项目的调试经验,详细说明了SMMU电源管理、NUMA放置、NCCL队列对并发以及硬件缺陷等配置问题如何导致AI集群8-12%的训练吞吐量差距,以及如何诊断和修复这些问题。

0 人收藏 0 人点赞
#performance-tuning

充分发挥MTP的性能

Reddit r/LocalLLaMA · 2026-07-24

一份通过调整n_max参数来优化MTP(多令牌预测)性能的指南,附带了多种模型(如Gemma-31b和Qwen)在P100和V100 GPU上的基准测试结果。

0 人收藏 0 人点赞
#performance-tuning

我优化训练流水线的经验:从36步/分钟到47步/分钟

Reddit r/LocalLLaMA · 2026-07-21

作者分享了将训练流水线性能从36步/分钟提升到47步/分钟的技术。

0 人收藏 0 人点赞
#performance-tuning

我们将PgBouncer扩展到4倍吞吐量

Hacker News Top · 2026-07-11 缓存

ClickHouse Managed Postgres通过运行一组使用SO_REUSEPORT的进程,将PgBouncer扩展到4倍吞吐量,实现了多核利用率,并通过对等连接解决了取消转发问题。

0 人收藏 0 人点赞
#performance-tuning

在优化垃圾回收器之前先调优代码

Hacker News Top · 2026-07-08 缓存

基准测试表明,优化Java代码(例如减少SLF4J日志记录)对延迟的影响远大于选择垃圾回收器,尤其是在高百分位下。

0 人收藏 0 人点赞
#performance-tuning

@SaitoWu: https://x.com/SaitoWu/status/2069076084495438186

X AI KOLs Timeline · 2026-06-22 缓存

文章介绍了使用 Codex AI agent 自动将终端 shell 配置从 Oh My Zsh 迁移到 Zinit + Starship + Rust 工具链的过程,展示了 AI 在执行备份、密钥隔离、性能分析等工程化步骤中的能力,最终实现了启动速度的数量级提升。

0 人收藏 0 人点赞
#performance-tuning

@charles_irl: Tried to squeeze the most important bits about the entire stack for cloud deployment of transformer inference, from app…

X AI KOLs Following · 2026-06-10 缓存

本文全面介绍了云端部署 Transformer 推理的完整技术栈,涵盖应用场景、工作负载定义、模型、推理引擎、硬件、可观测性及性能优化,并展望了未来趋势。

0 人收藏 0 人点赞
#performance-tuning

Qwen 3.6-35B-A3B 在 Intel Arc B70 Pro 上实现 977 tok/s 提示处理与 26.2万上下文窗口

Reddit r/LocalLLaMA · 2026-06-02 缓存

本文介绍如何使用 llama.cpp 的 SYCL 后端,在 Intel Arc Pro B70 GPU 上使整个模型和 KV 缓存位于显存中,从而实现 Qwen 3.6-35B-A3B 模型每秒超过 60 个 token 的处理速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈