标签
有用户报告,对于 Gemma 4 31b,将 f16 MTP 草稿模型量化到 Q4_K(而不是默认的 Q4_0)在双 3090 上解码速度大约提升 10%(从 65 TPS 到 72 TPS),而 Q2_K 表现更差。
Unsloth AI 宣布推出 DSpark,使 DeepSeek-V4-Flash GGUF 模型在本地运行速度提升约 1.4–2 倍,达到 120 tokens/s,且准确率无变化。
详细测试和调优,以在RTX 3090上优化GGUF格式的DeepSeek-V4-Flash-0731,通过不同的量化和加载参数,在128K上下文下达到约15 tok/s。
讨论:对于Qwen 3.5 397B或GLM-5.2等大模型,极高的解码速度(1k-10k tok/s)是否能解锁新的应用场景,还是更适合用来加载更大的模型。
Google Gemma宣布,借助Hugging Face和Cerebras实现超快推理,开发者现在可以将Gemma 4 31B模型用作语音AI的大脑,这是开源级联语音到语音堆栈的一部分。
空间推测解码(SSD)通过使用小型辅助网络并行预测整行像素,加速了自回归图像模型,实现了高达13.28倍的加速,同时保持了基准性能。
英伟达研究人员推出了SparDA,这是一种新的Transformer变体,它增加了一个第四投影(Forecast)来预测下一层的KV块,从而支持从CPU内存预取并降低选择成本,实现了解码速度提升1.7倍,并在长程推理任务上准确率提升6.5个百分点。
NVIDIA的Puzzle-75B-A9B模型在三块RTX 3090 GPU上使用NVFP4量化达到每秒132个token,引发了对该模型尺寸类别缺乏竞争的讨论。
一位用户通过优化llama.cpp,在4张RTX 3090 GPU上实现了DeepSeek V4 Flash推理速度29倍提升,将23K提示从25分钟缩短至53秒。
一位用户在llama.cpp中测试了新合并的DFlash推测解码方法(Qwen 3.6 27B),在36K上下文下相比基准实现速度提升高达4.44倍,并附有详细的排行榜和质量测试。
NVIDIA提出了一种方法,将任何LLM转换为更快的版本,方法是将模型拆分为两个副本:一个冻结用于上下文,另一个训练用于并行生成多个token,实现了2.4倍加速,且质量保留约99%,仅使用了8%的训练数据。
一位用户考虑购买四块Ascend GX10来运行GLM5.2,提到性能数据:提示处理400-500 tok/s,128k上下文下输出约15 tok/s,并计划用于未来的开源模型。
Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。
FlexiSLM 为语音语言模型引入动态帧率能力,适用于语音输入与输出,性能优于固定帧率模型,并实现可控推理速度。
Sam Altman 宣布,一款每秒750个token的模型将在七月以5.6 SOL的价格提供。
一家种子阶段的YC初创公司Wafer AI正在推理速度竞赛中竞争,Databricks在GLM-5.2上实现了392 token/s,在Artificial Analysis中排名第一。
一个包含100多个AI智能体协作一周以提升vLLM中Gemma 4推理速度的实验,最终实现了5倍加速,并揭示了自我监管、分工协作和知识共享等涌现行为。
几何动作模型将几何基础模型用于机器人策略学习,在LIBERO-Plus上达到85.5%的准确率,推理仅需6.9毫秒,比基线模型快55倍。
MiniMax Sparse Attention (MSA) 通过增加一个路由分支,选择性选择键值块进行注意力计算,在100万token时实现了注意力计算量最高减少28.4倍,在H800 GPU上实现了14.2倍更快的预填充和7.6倍更快的解码,同时匹配全注意力基准性能。
Modal、SGLang 和 Z Lab 之间的合作将 DFlash 推测方案集成到 SGLang 中,为阿里巴巴的 Qwen 397B-A17B 模型实现了高达 4.3 倍的吞吐量提升,推动了开放智能的发展。