inference-speed

标签

Cards List
#inference-speed

使用 Q4_K MTP 草稿模型与 Gemma 4 31b 解码速度提升 10%

Reddit r/LocalLLaMA · 2天前

有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。

0 人收藏 0 人点赞
#inference-speed

@YRSM_Simon:120 t/s!干得好,@UnslothAI

X AI KOLs Following · 2天前 缓存

Unsloth AI 宣布推出 DSpark,使 DeepSeek-V4-Flash GGUF 模型在本地运行速度提升约 1.4–2 倍,达到 120 tokens/s,且准确率无变化。

0 人收藏 0 人点赞
#inference-speed

最终优化:在1块RTX 3090上,DeepSeek-V4-Flash-0731在128K上下文下从约10 tok/s提升至约15 tok/s

Reddit r/LocalLLaMA · 2天前

详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。

0 人收藏 0 人点赞
#inference-speed

极高的解码速度(tok/s)真的有用吗?

Reddit r/LocalLLaMA · 2026-07-30

讨论:对于Qwen 3.5 397B或GLM-5.2等大模型,极高的解码速度(1k-10k tok/s)是否能解锁新的应用场景,还是更适合用来加载更大的模型。

0 人收藏 0 人点赞
#inference-speed

@googlegemma: 无需等待的语音AI!感谢Hugging Face和Cerebras,开发者现在可以用Gemma 4 31B模型作为……

X AI KOLs Timeline · 2026-07-20 缓存

Google Gemma宣布,借助Hugging Face和Cerebras实现超快推理,开发者现在可以将Gemma 4 31B模型用作语音AI的大脑,这是开源级联语音到语音堆栈的一部分。

0 人收藏 0 人点赞
#inference-speed

@rohanpaul_ai: 空间推测解码(SSD)通过并行预测图像行,将自回归图像模型的速度提升高达13.28倍

X AI KOLs Timeline · 2026-07-14 缓存

空间推测解码(SSD)通过使用小型辅助网络并行预测整行像素,加速了自回归图像模型,实现了高达13.28倍的加速,同时保持了基准性能。

0 人收藏 0 人点赞
#inference-speed

@_avichawla: 英伟达研究人员构建了一种新的Transformer变体。对层结构做了一个小改动:- 解码速度提升1.7倍 - long-…

X AI KOLs Timeline · 2026-07-12 缓存

英伟达研究人员推出了SparDA,这是一种新的Transformer变体,它增加了一个第四投影(Forecast)来预测下一层的KV块,从而支持从CPU内存预取并降低选择成本,实现了解码速度提升1.7倍,并在长程推理任务上准确率提升6.5个百分点。

0 人收藏 0 人点赞
#inference-speed

NVIDIA Puzzle-75B-A9B 在3×3090上使用NVFP4达到132 t/s——为何这个尺寸类别在其他方面是一片荒漠?

Reddit r/LocalLLaMA · 2026-07-09

NVIDIA的Puzzle-75B-A9B模型在三块RTX 3090 GPU上使用NVFP4量化达到每秒132个token,引发了对该模型尺寸类别缺乏竞争的讨论。

0 人收藏 0 人点赞
#inference-speed

@superalesha: 我在4张RTX 3090上把DeepSeek V4 Flash推理速度提升了29倍!!!不是开玩笑。15 → 443 t/s。一个23K的提示原本需要25分钟……

X AI KOLs Timeline · 2026-07-07 缓存

一位用户通过优化llama.cpp,在4张RTX 3090 GPU上实现了DeepSeek V4 Flash推理速度29倍提升,将23K提示从25分钟缩短至53秒。

0 人收藏 0 人点赞
#inference-speed

我在llama.cpp中测试了最新合并的DFlash在Qwen 3.6 27B本地AI上的表现。36K上下文速度提升4.44倍。以下是我的发现(RTX 6000 PRO)。

Reddit r/LocalLLaMA · 2026-07-07

一位用户在llama.cpp中测试了新合并的DFlash推测解码方法(Qwen 3.6 27B),在36K上下文下相比基准实现速度提升高达4.44倍,并附有详细的排行榜和质量测试。

0 人收藏 0 人点赞
#inference-speed

@LiorOnAI:现在你可以将任何LLM转换成更快的版本,而无需从头重新训练。NVIDIA刚刚在他们30B的模型上实现了这一点。她…

X AI KOLs Timeline · 2026-07-01 缓存

NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。

0 人收藏 0 人点赞
#inference-speed

考虑入手4块Ascend GX10

Reddit r/LocalLLaMA · 2026-07-01

一位用户考虑购买四块Ascend GX10来运行GLM5.2,提到性能数据:提示处理400-500 tok/s,128k上下文下输出约15 tok/s,并计划用于未来的开源模型。

0 人收藏 0 人点赞
#inference-speed

@MiaAI_lab: Nvidia又做到了!@NVIDIAAI的Qwen 3.6 27B NVFP4比Unsloth的Qwen 3.6 27B NVFP4在D…上快了约41%

X AI KOLs Timeline · 2026-06-30 缓存

Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。

0 人收藏 0 人点赞
#inference-speed

FlexiSLM:动态可控制帧率的语音语言模型

Hugging Face Daily Papers · 2026-06-30 缓存

FlexiSLM 为语音语言模型引入动态帧率能力,适用于语音输入与输出,性能优于固定帧率模型,并实现可控推理速度。

0 人收藏 0 人点赞
#inference-speed

@sama: 哦对了……750 token/sec 将在七月以5.6 SOL 提供!

X AI KOLs · 2026-06-26

Sam Altman 宣布,一款每秒750个token的模型将在七月以5.6 SOL的价格提供。

0 人收藏 0 人点赞
#inference-speed

@agupta:我很喜欢在这场速度竞赛中,有一家种子阶段的YC公司@wafer_ai在争夺榜首位置

X AI KOLs Following · 2026-06-25 缓存

一家种子阶段的YC初创公司Wafer AI正在推理速度竞赛中竞争,Databricks在GLM-5.2上实现了392 token/s,在Artificial Analysis中排名第一。

0 人收藏 0 人点赞
#inference-speed

@Thom_Wolf:多智能体协作是当前最有趣的智能体行为之一!我们前几天做了一个实验……

X AI KOLs Timeline · 2026-06-25 缓存

一个包含100多个AI智能体协作一周以提升vLLM中Gemma 4推理速度的实验,最终实现了5倍加速,并揭示了自我监管、分工协作和知识共享等涌现行为。

0 人收藏 0 人点赞
#inference-speed

@HuggingPapers:用于机器人策略学习的几何动作模型,复用几何基础模型作为感知的骨干网络…

X AI KOLs Following · 2026-06-16 缓存

几何动作模型将几何基础模型用于机器人策略学习,在LIBERO-Plus上达到85.5%的准确率,推理仅需6.9毫秒,比基线模型快55倍。

0 人收藏 0 人点赞
#inference-speed

@rohanpaul_ai: 相当惊人,MiniMax Sparse Attention 在100万token时将注意力计算量减少28.4倍,预填充速度提升14.2倍,以及…

X AI KOLs Following · 2026-06-15 缓存

MiniMax Sparse Attention (MSA) 通过增加一个路由分支,选择性选择键值块进行注意力计算,在100万token时实现了注意力计算量最高减少28.4倍,在H800 GPU上实现了14.2倍更快的预填充和7.6倍更快的解码,同时匹配全注意力基准性能。

0 人收藏 0 人点赞
#inference-speed

@charles_irl: 许多人迟来地意识到智能必须开放。开放智能要成功,开发者必须携手合…

X AI KOLs Following · 2026-06-15 缓存

Modal、SGLang 和 Z Lab 之间的合作将 DFlash 推测方案集成到 SGLang 中,为阿里巴巴的 Qwen 397B-A17B 模型实现了高达 4.3 倍的吞吐量提升,推动了开放智能的发展。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈