inference-optimization

标签

Cards List
#inference-optimization

两个标志将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8提升到38.7 tok/s

Reddit r/LocalLLaMA · 18小时前

本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。

0 人收藏 0 人点赞
#inference-optimization

Auto-fit vs tuned MoE offload: 564 → 1330 pp tok/s, unchanged decode (Qwen3.6-35B-A3B Q6 / RTX 3090)

Reddit r/LocalLLaMA · 3天前

A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.

0 人收藏 0 人点赞
#inference-optimization

基于肘部的MoE路由:一种免训练的推理时插件用于专家选择

arXiv cs.LG · 4天前 缓存

本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。

0 人收藏 0 人点赞
#inference-optimization

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

arXiv cs.CL · 6天前 缓存

This empirical study examines practical online KV cache compaction for LLM agents, comparing token eviction and attention matching methods under different proxy query sources. It finds that delaying compaction to use future agent queries recovers performance, and token eviction preserves accuracy while reducing KV cache by 80%.

0 人收藏 0 人点赞
#inference-optimization

Fast Gemma 的已验证推理优化配方(7 分钟阅读)

TLDR AI · 6天前 缓存

VIDRAFT 团队分享了他们在 Fast Gemma 挑战赛中使用的已验证的最先进推理优化配方,在单个 A10G 上使用完全公开的基于 vLLM 的配置,实现了 510.58 TPS,PPL 为 2.39。

0 人收藏 0 人点赞
#inference-optimization

更小、更快、更安全:大规模运行Kimi和GLM

Hacker News Top · 6天前 缓存

Cloudflare详细介绍了如何利用FP8 KV缓存量化和权重压缩,高效服务Kimi K2.6和GLM 5.2等大型开源MoE模型,在不损失准确性的情况下提升吞吐量并降低成本。

0 人收藏 0 人点赞
#inference-optimization

BLADE:面向高效LLM推理的边界扩展与层自适应动态退出

arXiv cs.CL · 2026-08-03 缓存

BLADE是一个轻量级框架,通过将探测检查点扩展到句子边界、自我怀疑边界和段落边界,并自适应地选择信息量大的隐藏层,来动态终止LLM推理。在Qwen3模型上的实验表明,BLADE在保持接近基线的准确率的同时,在Qwen3-8B上减少了24.8%的词元,在Qwen3-4B上减少了15.8%。

0 人收藏 0 人点赞
#inference-optimization

@wafer_ai:突发新闻 我们又上 Hacker News 了 我们找到了如何在……上以 3.8 倍吞吐量和 71% 更低成本服务 Kimi K3

X AI KOLs Following · 2026-08-02 缓存

Wafer 宣布,它可以在 AMD MI355X 上以比 B200 节点高 3.8 倍的吞吐量和低 71% 的成本服务 Kimi K3,并认为 AMD 的大容量显存和软件支持使其成为前沿模型中性价比最高的选择。

0 人收藏 0 人点赞
#inference-optimization

Deepseek v4 flash - prefill/pp中每秒处理速度提升100-150 t/s

Reddit r/LocalLLaMA · 2026-08-02

这篇文章分享了提升DeepSeek v4 Flash预填充/PP速度的修复方法:将CUDA从13.3降级到13.1,或使用自定义fork,最高可实现1.3K的提示处理token/秒。

0 人收藏 0 人点赞
#inference-optimization

Kimi K3 如何通过工程创新跻身前沿 [R]

Reddit r/MachineLearning · 2026-07-30

Moonshot 推出的 Kimi K3 是一款开放权重的模型,在 580 个模型中排名第四。其创新包括 Kimi Delta Attention(减少 KV 缓存内存)、Quantile Balancing(专家负载均衡)以及 AgentENV(高效 RL 训练沙盒)。

0 人收藏 0 人点赞
#inference-optimization

GPT-5.6 Sol 帮助优化自身推理

Reddit r/singularity · 2026-07-29

OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。

0 人收藏 0 人点赞
#inference-optimization

GPT-5.6如何融合前沿智能与前沿效率

OpenAI Blog · 2026-07-29 缓存

OpenAI发布了GPT-5.6模型系列,包括Sol、Terra和Luna,这些模型在显著提升效率和降低成本的同时实现了前沿智能,背后是推理和智能体框架的创新。

0 人收藏 0 人点赞
#inference-optimization

@eisokant: 激动地宣布今天与@eigenlabs共同推出http://MLX.fast。这是一个开放的自动研究竞赛,旨在使Laguna XS 2.1在…

X AI KOLs Following · 2026-07-28 缓存

Eigen Labs 发起了一项名为 MLX.fast 的开放自动研究竞赛,旨在优化 Laguna XS 2.1 模型在消费级 Mac 上的推理速度,通过社区贡献使其尽可能快。

0 人收藏 0 人点赞
#inference-optimization

spec: 添加DSpark推测解码 by wjinxu · 拉取请求 #25173 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-07-28 缓存

通过拉取请求向llama.cpp添加DSpark推测解码支持,提升推理性能。

0 人收藏 0 人点赞
#inference-optimization

MM-ShiftKV: 解码感知的预填充阶段KV选择用于多模态大语言模型

arXiv cs.AI · 2026-07-28 缓存

MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。

0 人收藏 0 人点赞
#inference-optimization

PorTAL(1分钟阅读)

TLDR AI · 2026-07-28 缓存

介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。

0 人收藏 0 人点赞
#inference-optimization

Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s

Reddit r/LocalLLaMA · 2026-07-27

Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。

0 人收藏 0 人点赞
#inference-optimization

面向V100用户:SGLang运行Qwen+Dflash和Laguna

Reddit r/LocalLLaMA · 2026-07-27

修改SGLang以在V100 GPU上支持Qwen和Laguna模型,使用自定义的FlashAttention和Marlin内核,在4xV100硬件上获得了不错的吞吐量。

0 人收藏 0 人点赞
#inference-optimization

我们如何打造 GLM-5.2 全新最快的 API(5分钟阅读)

TLDR AI · 2026-07-27 缓存

Baseten 详细介绍了如何为 GLM-5.2 构建最快的 API,其性能超过发布时的两倍,并推出了针对编码和智能体优化的低延迟 Fast 版本,同时计划进一步改进。

0 人收藏 0 人点赞
#inference-optimization

在我的个人设置上测试了草稿链论文。相同答案减少了74%的令牌数。

Reddit r/AI_Agents · 2026-07-24

作者在自己的设置上测试了草稿链论文,实现了相同答案减少74%的令牌数。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈