throughput

标签

Cards List
#throughput

接受长度越高,文本越慢:Ling在单台Spark上的n=1/2/3 MTP测试

Reddit r/LocalLLaMA · 5天前

对Ling-3.0-flash的基准测试显示,在多令牌预测中,更高的接受长度会降低文本吞吐量,其中n=1是所评估工作负载中最高效的设置。

0 人收藏 0 人点赞
#throughput

Random Attention:重新思考高效推理的KV缓存驱逐策略

Hugging Face Daily Papers · 2026-09-03 缓存

本文提出了一种名为Random Attention的KV缓存驱逐方法,它使用随机选择而非评分,匹配选择性方法的同时提高推理任务中的吞吐量。

0 人收藏 0 人点赞
#throughput

NVIDIA报告称,Vera Rubin的智能体吞吐量每兆瓦最高提升30倍——但每兆瓦的令牌数仍不等同于每兆瓦的完成工作量

Reddit r/ArtificialInteligence · 2026-08-26

NVIDIA报告称,与GB300相比,Vera Rubin的每兆瓦智能体吞吐量最高提升30倍,但强调生产基准测试应包含超越每瓦令牌数的额外指标。

0 人收藏 0 人点赞
#throughput

每瓦功耗工作量提升高达30倍:NVIDIA Vera Rubin NVL72为AI智能体树立新能效标准

NVIDIA Blog · 2026-08-24 缓存

NVIDIA Vera Rubin NVL72系统在智能体AI工作负载中,展现出每兆瓦吞吐量提升高达30倍的性能,为AI基础设施设定了新的效率标准。

0 人收藏 0 人点赞
#throughput

Wi-Fi 8 是多年来首个不追求速度的无线升级

Hacker News Top · 2026-08-23 缓存

Wi-Fi 8 将重点从速度转向可靠性,旨在减少干扰和延迟,同时保持与 Wi-Fi 7 相似的数据速率。

0 人收藏 0 人点赞
#throughput

@maximelabonne: 自然已愈合:LFM2.5-2.6B 在 OpenRouter 上免费提供且吞吐量良好!今天就在你最喜欢的智能体框架中试试吧。

X AI KOLs Following · 2026-08-21 缓存

LFM2.5-2.6B AI模型已在OpenRouter上免费提供,且具有良好的吞吐量,推荐用于智能体框架应用。

0 人收藏 0 人点赞
#throughput

我测量了上次本地代理帖子中本子版块用户提出的三项主张。你们中有一位的预测超越了我自己的假设。学习一切而非知晓一切的规则

Reddit r/AI_Agents · 2026-08-19

用户测试了使用Qwen 27B模型扩展本地AI代理,发现由于内存带宽限制,添加更多代理仅能将吞吐量提高到一定程度,且长提示从并行中获益更多。

0 人收藏 0 人点赞
#throughput

DFlash 2:保持并行起草

Reddit r/LocalLLaMA · 2026-08-18 缓存

DFlash 2 通过并行预测令牌改进推测解码,在最小延迟下实现每次验证通过时输出增加超过20%,并集成到主要推理引擎如 SGLang 和 vLLM 中。

0 人收藏 0 人点赞
#throughput

A 124B 在单台 DGX Spark 上单次响应生成了 15,128 个 token,解码速度全程保持 35.62 → 35.68 tok/s

Reddit r/LocalLLaMA · 2026-08-13

对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。

0 人收藏 0 人点赞
#throughput

并发 vs. 吞吐量:为什么更多并行性反而会让数据库变慢

Lobsters Hottest · 2026-08-07 缓存

PlanetScale 的一篇工程博客分析了由长事务和高并发导致的 MySQL 宕机,解释了并行性如何降低吞吐量,以及 Vitess 的事务池如何处理(并放大)了该问题。

0 人收藏 0 人点赞
#throughput

@TeachTheMachine:衡量Transformer推理性能

X AI KOLs Timeline · 2026-08-06 缓存

一份关于衡量Transformer推理性能的实用教程,涵盖延迟、TTFT、吞吐量、内存使用等指标,以及针对LLM的基准测试技术。

0 人收藏 0 人点赞
#throughput

Intern S2 Mobius

Reddit r/LocalLLaMA · 2026-08-05

Intern-S2 Mobius 是一个基于 Qwen3.5-35B 的模型,其架构差异据称可提高吞吐量并减少 token 消耗。

0 人收藏 0 人点赞
#throughput

@wafer_ai:突发新闻 我们又上 Hacker News 了 我们找到了如何在……上以 3.8 倍吞吐量和 71% 更低成本服务 Kimi K3

X AI KOLs Following · 2026-08-02 缓存

Wafer 宣布,它可以在 AMD MI355X 上以比 B200 节点高 3.8 倍的吞吐量和低 71% 的成本服务 Kimi K3,并认为 AMD 的大容量显存和软件支持使其成为前沿模型中性价比最高的选择。

0 人收藏 0 人点赞
#throughput

@FinanceYF5: Kimi K3爆红两天,Deedy说这背后是一整套算力经济学 1/ K3上线才两天,冲到OpenRouter第10名,日均1400亿Token,但服务器已经扛不住了。 吞吐从30 Token/s掉到13,延迟飙到72秒,首字等待超过20秒…

X AI KOLs Following · 2026-07-20 缓存

Kimi K3上线两天即冲到OpenRouter第10名,日均处理1400亿Token,但因负载过高导致吞吐下降、延迟飙升。

0 人收藏 0 人点赞
#throughput

@NVIDIAAI: 随着AI模型在规模和能力上不断增长,塑造模型与其大小同等重要。我们正在推出…

X AI KOLs Timeline · 2026-07-13 缓存

NVIDIA推出关于AI模型协同设计(AI Model Co-Design)的系列内容,解释模型维度如何影响GPU性能,以及LLM部署中吞吐量与交互性之间的权衡。第一篇文章提供了设计硬件友好型LLM的实用入门指南,以提升系统吞吐量和用户响应速度。

0 人收藏 0 人点赞
#throughput

4-Bitter的教训:在NVFP4 RL中平衡稳定性与性能

Hacker News Top · 2026-07-10 缓存

本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。

0 人收藏 0 人点赞
#throughput

@WescheNex1q: 16人同时与Qwen3.6-35B聊天,仅用一台DGX Spark。这是真实截图,并非模拟:您看到的每个token均…

X AI KOLs Timeline · 2026-07-09 缓存

一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。

0 人收藏 0 人点赞
#throughput

@YRSM_Simon: 疯狂

X AI KOLs Timeline · 2026-07-09 缓存

DeepSeek-V4-Flash-DSpark 在 4 块 RTX PRO 6000 GPU 上实现了 328 tok/s 的单次推理和 1.7k tok/s 的批量吞吐量。

0 人收藏 0 人点赞
#throughput

@Alacritic_Super: 如果你想掌握LLM推理,从这三篇论文开始。它们介绍了许多驱动当今…的核心理念。

X AI KOLs Timeline · 2026-07-08 缓存

这个线程推荐了三篇掌握LLM推理的关键论文:PagedAttention、Sarathi-Serve和SGLang,它们介绍了高效的内存管理、分块预填充和结构化生成技术,这些技术被用于现代推理引擎如vLLM和TensorRT-LLM中。

0 人收藏 0 人点赞
#throughput

Nemotron-Labs-Diffusion: 统一自回归、扩散与自推测解码的三模式语言模型

Hugging Face Daily Papers · 2026-07-07 缓存

本文介绍了Nemotron-Labs-Diffusion,一种三模式语言模型,统一了自回归、扩散与自推测解码,与现有模型相比实现了更优的吞吐量和效率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈