inference-performance

标签

Cards List
#inference-performance

在一台 DGX Spark 上对 124B 模型进行了一周基准测试并全部公开——他找到的最快路径为 38.7 tok/s,比同机上的 DeepSeek V4 Flash 快 2.4 倍

Reddit r/LocalLLaMA · 4天前

sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。

0 人收藏 0 人点赞
#inference-performance

@AstroHanRay: 对比了下,Ollama Cloud 的 tokens/s 比 http://Z.ai 的 Max 套餐高 40%,首字延迟更是低非常多,流式输出几乎秒回。 各家套餐都用下来,我还是觉得 Ollama Cloud 是使用 GLM-5.2 的…

X AI KOLs Timeline · 2026-07-05 缓存

AstroHanRay 对比了 Ollama Cloud 和 Z.ai Max 套餐,发现 Ollama Cloud 在吞吐量和首字延迟上明显优于 Z.ai,推荐使用 Ollama Cloud 运行 GLM-5.2 模型。

0 人收藏 0 人点赞
#inference-performance

@jun_song: 如果苹果很快推出 M5 Ultra Mac Studio,我会立即下单最大内存版本。毫不犹豫。M3 Ultra…

X AI KOLs Following · 2026-06-21 缓存

作者表示,如果苹果很快发布 M5 Ultra Mac Studio,他会立即订购最大内存版本,理由是 M3 Ultra 的高转售价值以及 M5 在推理性能上的巨大飞跃。

0 人收藏 0 人点赞
#inference-performance

@derangineer: 游戏中的山羊

X AI KOLs Following · 2026-06-11 缓存

Charles Frye 宣布了一篇博客文章,详细介绍了对 FA4 内部结构的贡献,重点在于已上游的推理性能改进。

0 人收藏 0 人点赞
#inference-performance

llama.cpp 中的流水线并行可能浪费你的显存

Reddit r/LocalLLaMA · 2026-06-08

测试表明,llama.cpp 默认的流水线并行浪费显存且无速度提升;通过编译时设置 GGML_SCHED_MAX_COPIES=1 可节省大量显存,同时保持相同推理速度。

0 人收藏 0 人点赞
#inference-performance

@Snixtp: 针对单张 RTX 3090 的更多能效测试 长文速读:- 我在单张 RTX 3090 上测试了 8 个本地大语言模型(LLM),功率限制从 100W 到 45…

X AI KOLs Following · 2026-05-08

本文展示了 8 个本地大语言模型在 RTX 3090 上的基准测试结果,显示功率能效在约 225W 时达到峰值,而在满功率下收益递减。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈