performance-tuning

标签

Cards List
#performance-tuning

llama.cpp 与 Qwen 3.8 配合使用的最佳设置

Reddit r/LocalLLaMA · 2天前

本文提供了使用 Qwen 3.8 模型与 llama.cpp 的优化设置,重点介绍了在 RTX 3090 GPU 上令牌生成速度和上下文窗口管理的性能提升。

0 人收藏 0 人点赞
#performance-tuning

Qwen3.8-Flash 在 RTX3090 + 64GB RAM 上运行(但你只需 12GB VRAM)

Reddit r/LocalLLaMA · 4天前

本文提供了在 RTX 3090 和 64GB RAM 上运行 Qwen3.8-Flash AI 模型的详细指南,讨论了性能指标、量化设置以及使用 llamacpp 等工具的部署步骤。

0 人收藏 0 人点赞
#performance-tuning

调试我的新网络,当10 Gigabit Ethernet以300 Megabits运行时

Lobsters Hottest · 4天前 缓存

Scott Hanselman调试了10 Gigabit Ethernet的缓慢性能,通过调整Intel NIC的接收缓冲区和禁用Large Send Offload,发现了一个Windows特有的问题。

0 人收藏 0 人点赞
#performance-tuning

我逆向工程了 NPU 厂商的引擎格式(int8 权重存储为两个半字节平面)以运行 GGUF 而无需模型转换——现在比厂商自己的运行时快 1.5 倍

Reddit r/LocalLLaMA · 4天前

逆向工程了 Axera AX8850 NPU 的 int8 权重格式,以在 llama.cpp 中实现直接 GGUF 推理,在 Raspberry Pi 5 上实现了高达 24.5 t/s 的解码和 716 t/s 的预填充,性能比厂商的运行时高出 1.5 倍。

0 人收藏 0 人点赞
#performance-tuning

@ivanfioravanti: 我使用DwarfStar在M3 Ultra上追求DeepSeek-V4-Flash达到50 tps的进程仍在继续! - 45.7 → 51.5 tok/s (+12.6%) gree…

X AI KOLs Following · 5天前 缓存

文章详细介绍了使用DwarfStar推理引擎在M3 Ultra上实现DeepSeek-V4-Flash超过50 tokens每秒推理速度的进展,以及在性能和质量指标方面的改进。

0 人收藏 0 人点赞
#performance-tuning

借助R9700实现Strix Halo双倍性能提升

Reddit r/LocalLLaMA · 5天前

一位用户分享了如何通过将大型MoE模型分配到Strix Halo APU和R9700 GPU之间,实现AI推理性能翻倍,详细介绍了配置和代码修改。

0 人收藏 0 人点赞
#performance-tuning

在24核构建机器上添加CPU亲和性反而使构建变慢

Lobsters Hottest · 2026-08-25

一篇报告指出,在24核构建机器上启用CPU亲和性出乎意料地拖慢了构建速度,凸显了多核处理优化的复杂性。

0 人收藏 0 人点赞
#performance-tuning

我fork了Ninfer 3090并将其转换为在CMP170HX上运行 - 使llama.cpp的Qwen3.6-35B性能翻倍

Reddit r/LocalLLaMA · 2026-08-22

一位用户fork了Ninfer推理引擎以在CMP170HX GPU上运行,使llama.cpp的Qwen3.6-35B模型性能翻倍,并分享了配置细节。

0 人收藏 0 人点赞
#performance-tuning

我终于感觉像毕业了。

Reddit r/LocalLLaMA · 2026-08-21

用户从LM Studio切换到vLLM以服务Qwen 3.8模型,实现了每秒143个令牌的速度,并降低了GPU温度,参考了一个有用的GitHub仓库。

0 人收藏 0 人点赞
#performance-tuning

双3090配置:Qwen 3.6 27B 上从 400 pp tokens/s 提升到 1600 pp tokens/s... 但 tps 略降。

Reddit r/LocalLLaMA · 2026-08-06

使用双 RTX 3090 配置的用户发现,llama.cpp 的 `--split-mode tensor` 会在 CPU 上运行提示处理(约 400 t/s),而切换到 `--split-mode layer` 则可解锁 GPU 提示处理,速度超过 1600 t/s,且 token 生成速度仅略有下降。

0 人收藏 0 人点赞
#performance-tuning

NVIDIA Exemplar Cloud:在AI基础设施上释放全部性能的经验教训(12分钟阅读)

TLDR AI · 2026-07-31 缓存

NVIDIA分享了其Exemplar Cloud项目的调试经验,详细说明了SMMU电源管理、NUMA放置、NCCL队列对并发以及硬件缺陷等配置问题如何导致AI集群8-12%的训练吞吐量差距,以及如何诊断和修复这些问题。

0 人收藏 0 人点赞
#performance-tuning

充分发挥MTP的性能

Reddit r/LocalLLaMA · 2026-07-24

一份通过调整n_max参数来优化MTP(多令牌预测)性能的指南,附带了多种模型(如Gemma-31b和Qwen)在P100和V100 GPU上的基准测试结果。

0 人收藏 0 人点赞
#performance-tuning

我优化训练流水线的经验:从36步/分钟到47步/分钟

Reddit r/LocalLLaMA · 2026-07-21

作者分享了将训练流水线性能从36步/分钟提升到47步/分钟的技术。

0 人收藏 0 人点赞
#performance-tuning

我们将PgBouncer扩展到4倍吞吐量

Hacker News Top · 2026-07-11 缓存

ClickHouse Managed Postgres通过运行一组使用SO_REUSEPORT的进程,将PgBouncer扩展到4倍吞吐量,实现了多核利用率,并通过对等连接解决了取消转发问题。

0 人收藏 0 人点赞
#performance-tuning

在优化垃圾回收器之前先调优代码

Hacker News Top · 2026-07-08 缓存

基准测试表明,优化Java代码(例如减少SLF4J日志记录)对延迟的影响远大于选择垃圾回收器,尤其是在高百分位下。

0 人收藏 0 人点赞
#performance-tuning

@SaitoWu: https://x.com/SaitoWu/status/2069076084495438186

X AI KOLs Timeline · 2026-06-22 缓存

文章介绍了使用 Codex AI agent 自动将终端 shell 配置从 Oh My Zsh 迁移到 Zinit + Starship + Rust 工具链的过程,展示了 AI 在执行备份、密钥隔离、性能分析等工程化步骤中的能力,最终实现了启动速度的数量级提升。

0 人收藏 0 人点赞
#performance-tuning

@charles_irl: Tried to squeeze the most important bits about the entire stack for cloud deployment of transformer inference, from app…

X AI KOLs Following · 2026-06-10 缓存

本文全面介绍了云端部署 Transformer 推理的完整技术栈,涵盖应用场景、工作负载定义、模型、推理引擎、硬件、可观测性及性能优化,并展望了未来趋势。

0 人收藏 0 人点赞
#performance-tuning

Qwen 3.6-35B-A3B 在 Intel Arc B70 Pro 上实现 977 tok/s 提示处理与 26.2万上下文窗口

Reddit r/LocalLLaMA · 2026-06-02 缓存

本文介绍如何使用 llama.cpp 的 SYCL 后端,在 Intel Arc Pro B70 GPU 上使整个模型和 KV 缓存位于显存中,从而实现 Qwen 3.6-35B-A3B 模型每秒超过 60 个 token 的处理速度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈