标签
本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。
A developer benchmarks Qwen3.6-35B-A3B Q6 on an RTX 3090, showing that offloading eight MoE expert layers to CPU and increasing batch sizes improves prompt processing by 2.36× (564→1330 tok/s) with no decode speed regression, using evolutionary search to find the tuning config.
本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。
This empirical study examines practical online KV cache compaction for LLM agents, comparing token eviction and attention matching methods under different proxy query sources. It finds that delaying compaction to use future agent queries recovers performance, and token eviction preserves accuracy while reducing KV cache by 80%.
VIDRAFT 团队分享了他们在 Fast Gemma 挑战赛中使用的已验证的最先进推理优化配方,在单个 A10G 上使用完全公开的基于 vLLM 的配置,实现了 510.58 TPS,PPL 为 2.39。
Cloudflare详细介绍了如何利用FP8 KV缓存量化和权重压缩,高效服务Kimi K2.6和GLM 5.2等大型开源MoE模型,在不损失准确性的情况下提升吞吐量并降低成本。
BLADE是一个轻量级框架,通过将探测检查点扩展到句子边界、自我怀疑边界和段落边界,并自适应地选择信息量大的隐藏层,来动态终止LLM推理。在Qwen3模型上的实验表明,BLADE在保持接近基线的准确率的同时,在Qwen3-8B上减少了24.8%的词元,在Qwen3-4B上减少了15.8%。
Wafer 宣布,它可以在 AMD MI355X 上以比 B200 节点高 3.8 倍的吞吐量和低 71% 的成本服务 Kimi K3,并认为 AMD 的大容量显存和软件支持使其成为前沿模型中性价比最高的选择。
这篇文章分享了提升DeepSeek v4 Flash预填充/PP速度的修复方法:将CUDA从13.3降级到13.1,或使用自定义fork,最高可实现1.3K的提示处理token/秒。
Moonshot 推出的 Kimi K3 是一款开放权重的模型,在 580 个模型中排名第四。其创新包括 Kimi Delta Attention(减少 KV 缓存内存)、Quantile Balancing(专家负载均衡)以及 AgentENV(高效 RL 训练沙盒)。
OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。
OpenAI发布了GPT-5.6模型系列,包括Sol、Terra和Luna,这些模型在显著提升效率和降低成本的同时实现了前沿智能,背后是推理和智能体框架的创新。
Eigen Labs 发起了一项名为 MLX.fast 的开放自动研究竞赛,旨在优化 Laguna XS 2.1 模型在消费级 Mac 上的推理速度,通过社区贡献使其尽可能快。
通过拉取请求向llama.cpp添加DSpark推测解码支持,提升推理性能。
MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。
介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。
Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。
修改SGLang以在V100 GPU上支持Qwen和Laguna模型,使用自定义的FlashAttention和Marlin内核,在4xV100硬件上获得了不错的吞吐量。
Baseten 详细介绍了如何为 GLM-5.2 构建最快的 API,其性能超过发布时的两倍,并推出了针对编码和智能体优化的低延迟 Fast 版本,同时计划进一步改进。
作者在自己的设置上测试了草稿链论文,实现了相同答案减少74%的令牌数。