performance-optimization

标签

Cards List
#performance-optimization

公告:llama.cpp 的 -cram 参数在代理工作流中应增加(默认为8192)

Reddit r/LocalLLaMA ↗ · 14小时前

基于个人在Qwen 27B 3.8上的经验,建议增加llama.cpp的-cram参数,以在长上下文的代理工作流中获得更好性能。

0 人收藏 0 人点赞
#performance-optimization

@yoheinakajima: glance-vlm speedlab 现已开源!阅读:https://glance.yohei.me/speed/ 尝试:https://github.com/yoheinakajima/glan…

X AI KOLs Timeline ↗ · 昨天 缓存

本文介绍了一项开源研究,通过基准测试和原生批处理、MLX量化等技术优化本地视觉语言模型的延迟,在Apple硬件上实现显著加速的同时保持决策准确性。

0 人收藏 0 人点赞
#performance-optimization

Claude 一旦能度量,就能提升速度

Hacker News Top ↗ · 昨天 缓存

在为期两周的冲刺中,团队使用内部 Claude 模型,将 claude.ai 和桌面应用上的关键用户旅程速度提升了 3 倍,显著减少了等待时间,且未发生任何面向客户的事件。

0 人收藏 0 人点赞
#performance-optimization

Apache Parquet 中的自适应无损浮点编码

Lobsters Hottest ↗ · 昨天 缓存

自适应无损浮点(ALP)编码是一种针对 Apache Parquet 中浮点数据的新轻量级编码,提供与 zstd 相似的压缩比,同时具有更快的解压速度、随机访问支持以及对 GPU/SIMD 友好的解码。

0 人收藏 0 人点赞
#performance-optimization

@charles_irl: 之后,人们一直问我们 @modal 是如何能够如此出色地提供代理推理服务的。所以我们把这一切都写了下来。新博…

X AI KOLs Timeline ↗ · 昨天 缓存

Modal 详细介绍了他们如何为万亿参数编码代理优化推理性能,为其服务在吞吐量和交互性方面实现了显著提升。

0 人收藏 0 人点赞
#performance-optimization

减少六层:Whisper编码器剪枝与无标签恢复

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了一种剪枝Whisper ASR模型编码器层的方法,将编码器大小减少18.5%,并通过无标签数据蒸馏恢复性能,同时发布了代码和预训练模型供采用。

0 人收藏 0 人点赞
#performance-optimization

Qwen3.8-Flash-Next 在 Strix Halo 上支持 100万上下文:解码速度达 38 tok/s,预填充仅需 18 分钟 (Halogen 0.12.0)

Reddit r/LocalLLaMA ↗ · 5天前

Halogen 版本 0.12.0 修复了高上下文深度下的性能下降问题,展示了在 AMD Ryzen AI Max+ 硬件上,Qwen3.8-Flash-Next 在 100万令牌上下文时的解码和预填充速度的提升。

0 人收藏 0 人点赞
#performance-optimization

Cache-to-Cache:大型语言模型之间的直接语义通信 (2025)

Hacker News Top ↗ · 6天前 缓存

本文提出Cache-to-Cache(C2C)这一新范式,利用KV-Cache实现大型语言模型之间的直接语义通信,相比基于文本的方法,能提升响应质量并减少延迟。

0 人收藏 0 人点赞
#performance-optimization

@akshay_pachaar: 在LLM推理中,VRAM都去哪儿了?(GPU内存的4种使用方式)加载模型只是内存故事的一部分…

X AI KOLs Timeline ↗ · 2026-09-17 缓存

本文解释了在大语言模型(LLM)推理过程中GPU内存的使用方式,将其分解为四个关键组件:模型权重、KV缓存、激活值/工作区和运行时开销。文章强调了量化在优化内存使用以提升性能方面的重要性。

0 人收藏 0 人点赞
#performance-optimization

尺寸特化内存分配

Hacker News Top ↗ · 2026-09-17 缓存

Go 1.27 引入尺寸特化内存分配,适用于80字节及以下的分配,将分配速度提升20-30%,并提升分配密集型代码的整体程序性能最多1%。

0 人收藏 0 人点赞
#performance-optimization

您可以将Qwen3.8-Flash-Next模型的大部分KV缓存卸载到RAM中,而不会明显影响解码速度。 在使用8bit量化的Qwen3.8-Flash-Next模型时,KV缓存大小约为每token 12.5MB。通过将大部分KV缓存从显存移至RAM,并只在显存中保留少量热数据,可以显著扩大显存能够支持的上下文长度。这种混合存储方式仅会增加约1.2ms的延迟,对实际推理速度影响微乎其微,为处理超长上下文提供了一种高效且低成本的解决方案。

Reddit r/LocalLLaMA ↗ · 2026-09-16

演示了将Qwen3.8-Flash-Next模型的KV缓存卸载至系统内存的技术,通过利用该模型高效架构,可在最大程度减少解码速度下降的情况下支持长上下文推理。

0 人收藏 0 人点赞
#performance-optimization

@devjoshstevens: 我们已构建内部的Polymarket索引系统,由Rust编写的rindexer提供支持。我们目前能够更快地处理链上数据事件……

X AI KOLs Timeline ↗ · 2026-09-15

Polymarket已构建内部索引系统,由Rust编写的rindexer提供支持,实现了交易、头寸和余额的近实时更新,链上数据事件处理速度提升多达28秒。

0 人收藏 0 人点赞
#performance-optimization

在共同发明ChatGPT后,我不断自问:为什么超人聊天模型没有导向AGI?我过去两年里一直在……

X AI KOLs Following ↗ · 2026-09-15 缓存

ChatGPT的共同发明者宣布发布名为Jev的新AI模型,采用RLCD训练,声称其速度快20-200倍,成本低40-400倍(输出代币免费),并针对可组合智能进行了优化,作为通往AGI的路径。

0 人收藏 0 人点赞
#performance-optimization

通过专家前瞻技术,在 MoE ssd-streaming 上实现 10% 以上的性能提升

Reddit r/LocalLLaMA ↗ · 2026-09-15

在采用 slotstream 技术的低内存设备上运行 MoE 模型时,专家前瞻技术的实现带来了超过 10% 的性能提升,修正模型还能带来额外的增益。

0 人收藏 0 人点赞
#performance-optimization

ggml-cuda: hip: 添加缺失的 AMD GCN MMQ 配置 by thelittlefireman · Pull Request #27841 · ggml-org/llama.cpp - RDNA2(MI50, MI60) 的预填充性能改进

Reddit r/LocalLLaMA ↗ · 2026-09-12 缓存

此拉取请求为 ggml-cuda 的 HIP 添加缺失的 AMD GCN MMQ 配置,增强了 llama.cpp 推理库中 RDNA2 GPU(如 MI50 和 MI60)的预填充性能。

0 人收藏 0 人点赞
#performance-optimization

@MaximeRivest: DSPy 3.4 候选版本已发布,我们正从 litellm 迁移。我一直困扰于 dspy 导入速度慢以及……

X AI KOLs Following ↗ · 2026-09-11 缓存

DSPy 3.4 候选版本已宣布,正从 litellm 迁移以提升导入速度并减少依赖。社区成员如 Drew Breunig 对改进表示赞赏。

0 人收藏 0 人点赞
#performance-optimization

从苹果神经引擎中恢复 50 GB/S 的性能

Hacker News Top ↗ · 2026-09-10 缓存

在苹果 M3 神经引擎中,当权重大小为 1 MiB 的倍数时,发现了性能节流问题,导致吞吐量下降。通过避开有问题的 DMA 路径,Llama 3.2 和 Qwen3-8B 等模型的 token 吞吐量得到了显著改善。

0 人收藏 0 人点赞
#performance-optimization

@ashxhart: 一直在给我的 M3 Ultra Studio 精心调校,并摆弄 MLX。下午开始时速度为 42 tok/s。现在:73 tok/s,而且…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一位作者改进了 M3 Ultra Studio 上的 MLX 性能,使 4 位量化的 Qwen3.8-Flash-Next 模型达到 73 tok/s,其智能评分与 GPT-5.6 Sol 相当,凸显了本地 AI 日益增长的潜力。

0 人收藏 0 人点赞
#performance-optimization

ukisai/Swift-Qwen3.8-27b

Hugging Face Models Trending ↗ · 2026-09-08 缓存

Swift-Qwen3.8-27B 是 UkisAI 基于 Qwen3.8-27B 开发的推理高效版本,可将思考令牌减少 58.3%,同时保持几乎相同的性能。

0 人收藏 0 人点赞
#performance-optimization

@_DivyaMakkar: 花了一些时间用纯 JAX 与 @AdityaMakkar0 一起创建了一个轻量级、高性能的异步 RL 堆栈!我们分享了一份工作日志 …

X AI KOLs Following ↗ · 2026-09-07

作者们用纯 JAX 创建了一个轻量级、高性能的异步强化学习堆栈,分享了一份关于推理、RDMA 权重传输、内存优化以及用于扩展 RL 系统的分片的见解的工作日志。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈