标签
对Ling-3.0-flash的基准测试显示,在多令牌预测中,更高的接受长度会降低文本吞吐量,其中n=1是所评估工作负载中最高效的设置。
本文提出了一种名为Random Attention的KV缓存驱逐方法,它使用随机选择而非评分,匹配选择性方法的同时提高推理任务中的吞吐量。
NVIDIA报告称,与GB300相比,Vera Rubin的每兆瓦智能体吞吐量最高提升30倍,但强调生产基准测试应包含超越每瓦令牌数的额外指标。
NVIDIA Vera Rubin NVL72系统在智能体AI工作负载中,展现出每兆瓦吞吐量提升高达30倍的性能,为AI基础设施设定了新的效率标准。
Wi-Fi 8 将重点从速度转向可靠性,旨在减少干扰和延迟,同时保持与 Wi-Fi 7 相似的数据速率。
LFM2.5-2.6B AI模型已在OpenRouter上免费提供,且具有良好的吞吐量,推荐用于智能体框架应用。
用户测试了使用Qwen 27B模型扩展本地AI代理,发现由于内存带宽限制,添加更多代理仅能将吞吐量提高到一定程度,且长提示从并行中获益更多。
DFlash 2 通过并行预测令牌改进推测解码,在最小延迟下实现每次验证通过时输出增加超过20%,并集成到主要推理引擎如 SGLang 和 vLLM 中。
对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。
PlanetScale 的一篇工程博客分析了由长事务和高并发导致的 MySQL 宕机,解释了并行性如何降低吞吐量,以及 Vitess 的事务池如何处理(并放大)了该问题。
一份关于衡量Transformer推理性能的实用教程,涵盖延迟、TTFT、吞吐量、内存使用等指标,以及针对LLM的基准测试技术。
Intern-S2 Mobius 是一个基于 Qwen3.5-35B 的模型,其架构差异据称可提高吞吐量并减少 token 消耗。
Wafer 宣布,它可以在 AMD MI355X 上以比 B200 节点高 3.8 倍的吞吐量和低 71% 的成本服务 Kimi K3,并认为 AMD 的大容量显存和软件支持使其成为前沿模型中性价比最高的选择。
Kimi K3上线两天即冲到OpenRouter第10名,日均处理1400亿Token,但因负载过高导致吞吐下降、延迟飙升。
NVIDIA推出关于AI模型协同设计(AI Model Co-Design)的系列内容,解释模型维度如何影响GPU性能,以及LLM部署中吞吐量与交互性之间的权衡。第一篇文章提供了设计硬件友好型LLM的实用入门指南,以提升系统吞吐量和用户响应速度。
本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。
一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。
DeepSeek-V4-Flash-DSpark 在 4 块 RTX PRO 6000 GPU 上实现了 328 tok/s 的单次推理和 1.7k tok/s 的批量吞吐量。
这个线程推荐了三篇掌握LLM推理的关键论文:PagedAttention、Sarathi-Serve和SGLang,它们介绍了高效的内存管理、分块预填充和结构化生成技术,这些技术被用于现代推理引擎如vLLM和TensorRT-LLM中。
本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。