performance

标签

Cards List
#performance

fearless_simd v0.7:64位整数、改进的泛型、SSE2 及即将到来的 v1.0

Lobsters Hottest · 23小时前 缓存

fearless_simd v0.7 新增了 64 位整数支持、SSE2 级别、改进的泛型及更多操作,v1.0 即将发布。

0 人收藏 0 人点赞
#performance

Performance impact of Alignment

Lobsters Hottest · 昨天 缓存

This technical blog post explains the performance impact of memory alignment in SIMD vectorization, covering architectures with strict alignment requirements, cacheline crossing, and the behavior of modern CPUs.

0 人收藏 0 人点赞
#performance

Llama-CPP 并行代理 --> 解码时很好,但一个代理的 prefill 会让所有其他代理陷入停顿

Reddit r/LocalLLaMA · 2天前

一位用户报告称,在 Llama-CPP 中使用并行子代理时,解码性能很好,但单个代理的 prefill(例如处理网络搜索)会使所有其他代理停滞不前,并请求调优建议。

0 人收藏 0 人点赞
#performance

@QuixiAI:我让 DeepSeek v4 Flash 0731 在 4x A100 上用 SlimServe 运行起来。单请求 175 tok/s,64 并发 1k tok/s…

X AI KOLs Timeline · 2天前 缓存

QuixiAI 报告称,使用 SlimServe 在 4x A100 上运行 DeepSeek v4 Flash 0731,单请求达到 175 tok/s,64 并发请求达到 1k tok/s。

0 人收藏 0 人点赞
#performance

将整数除法转换为浮点除法是微不足道的

Lobsters Hottest · 2天前 缓存

一篇技术博客文章,解释了如何使用浮点除法和融合乘加来执行整数除法和取余,并给出了操作数位宽的限制,同时讨论了SIMD和舍入模式的实际注意事项。

0 人收藏 0 人点赞
#performance

可达 253 t/s - unsloth/Muse Glimmer 30B UD-Q5_K_M 在 5090 上

Reddit r/LocalLLaMA · 2天前

在 RTX 5090 上对 unsloth 的 Muse Glimmer 30B 进行基准测试,采用推测解码,使用 DFlash 草稿模型和基于 GPU 的 argmax PR,最高可达 253 t/s,不过该 PR 仍是草稿状态。

0 人收藏 0 人点赞
#performance

Glimmer:5090上使用Dflash实现233.4 tps

Reddit r/LocalLLaMA · 2天前

据报道,Glimmer在RTX 5090上使用Dflash达到了233.4 tps,256k上下文可装进24GB显存,令用户兴奋不已。

0 人收藏 0 人点赞
#performance

重新平衡 Deflate 压缩级别

Lobsters Hottest · 2天前 缓存

Klaus Post 讨论了在 Go 压缩库中重新平衡 deflate 压缩级别的过程,以使速度/压缩的权衡更加线性和直观。

0 人收藏 0 人点赞
#performance

@nuskey8: 我们发布了 lkv,一个用 Rust 实现的新嵌入式数据库。它是一个专为点查找设计的轻量级 KVS,实现了高读取性能…

X AI KOLs Timeline · 3天前 缓存

nuskey8 发布了 lkv,这是一个用 Rust 编写的轻量级嵌入式键值存储,针对点查找进行了优化,声称比 SQLite 快约 165 倍,比 LMDB 快约 15 倍,且功能集极简。

0 人收藏 0 人点赞
#performance

C语言中的尾调用优化相对较新

Hacker News Top · 3天前 缓存

LWN的一条评论讨论了C语言编译器中尾调用优化相对较新的实现,引用了历史上的局限性,并指出现代的GCC和Clang现已支持该优化,这对解释器实现有潜在好处。

0 人收藏 0 人点赞
#performance

Fast Haskell Scripts on GitHub Actions

Lobsters Hottest · 3天前 缓存

The article explains how to speed up running Haskell scripts with Magix on GitHub Actions by caching dependencies and compiled artifacts, reducing full build times from over 100 seconds to near-instant reruns.

0 人收藏 0 人点赞
#performance

Go 中的性能剖析引导优化

Lobsters Hottest · 3天前 缓存

Daniel Lemire 对 Go 中的性能剖析引导优化(PGO)进行了基准测试,显示在解析 JSON 时速度提升约为 2-5%,当训练 profile 与工作负载匹配时效果最佳。

0 人收藏 0 人点赞
#performance

Windows 11 内置天气应用浪费超过 1 GB 内存

Hacker News Top · 3天前 缓存

Windows 11 内置的天气应用可能占用超过 1 GB 内存,约为 macOS 天气应用的五倍,原因是其基于 WebView2 的非原生架构。这可能会对配备 8-16 GB 内存的低端 PC 产生明显影响。

0 人收藏 0 人点赞
#performance

@tom_doerr:httptap 是一款 Python CLI,能将 HTTP 请求拆解为特定阶段,如 DNS 解析、TCP 连接、TLS 握手…

X AI KOLs Timeline · 4天前 缓存

httptap 是一个 Python CLI,可将 HTTP 请求剖析为 DNS、TCP、TLS 和数据传输等阶段,生成详细的瀑布时间线,用于故障排查和性能分析。

0 人收藏 0 人点赞
#performance

为消费级Nvidia显卡启用PCI-E P2P将带来超乎你想象的收益

Reddit r/LocalLLaMA · 4天前

通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。

0 人收藏 0 人点赞
#performance

@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……

X AI KOLs Following · 4天前 缓存

Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。

0 人收藏 0 人点赞
#performance

@TheAhmadOsman:顺便说一下,RTX PRO 6000 = 1.8TB/s,DGX Spark = 273GB/s。如果你的目标是本地AI代理和代理集群,应该追求更高的带宽……

X AI KOLs Timeline · 4天前 缓存

一条推文强调了RTX PRO 6000(1.8TB/s)和DGX Spark(273GB/s)之间的巨大带宽差异,认为对于本地AI代理和代理集群来说,更高的带宽至关重要。

0 人收藏 0 人点赞
#performance

@rohanpaul_ai:让 SQLite 提速 5% 就已经很厉害了。而一个名为 KISS Sorcar 的 AI 智能体在不到 8 小时内实现了 59% 的提升……

X AI KOLs Following · 5天前 缓存

一个名为 KISS Sorcar 的 AI 智能体在不到 8 小时内、花费不到 150 美元,在 SQLite 的四个基准测试上实现了经验证的 1.59 倍几何平均加速,并通过了超过 100 万项 SQLite 测试。这凸显了编码智能体不断增强的能力。

0 人收藏 0 人点赞
#performance

@TheAhmadOsman:在 DGX Station 上运行 DeepSeek V4 Flash 0731 的一些数据

X AI KOLs Timeline · 5天前 缓存

Ahmad Osman 分享了在 NVIDIA DGX Station 上运行 DeepSeek V4 Flash 0731 的性能数据。

0 人收藏 0 人点赞
#performance

我受够了我那300GB模型在RPC上加载要5分钟。PR 26291 将其加速300%,降至1分30秒(4060ti+ddr4)+(4060ti+ddr5)

Reddit r/LocalLLaMA · 5天前

llama.cpp/GGML 的 PR (26291) 将基于 RPC 的 300GB 模型加载速度提升了约 300%,在消费级硬件上通过 GGML_RPC_LOAD_THREADS 设置,将加载时间从约 5 分钟缩短至约 1.5 分钟。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈