model-inference

标签

Cards List
#model-inference

10 tokens per second 到底有多快?

Simon Willison's Blog · 2026-05-20 缓存

Simon Willison 探讨了 10 tokens per second 速度对于大型语言模型的实际意义,提供了关于这种速度感觉有多快以及其对可用性的影响的背景信息。

0 人收藏 0 人点赞
#model-inference

@julien_c: 我注意到网上有些困惑,关于如何以最简单的方式运行带MTP(多令牌预测)的llama.cpp……

X AI KOLs Following · 2026-05-19 缓存

Julien C 解释了如何运行带有MTP(多令牌预测)的llama.cpp,以实现约2倍的生成速度,可以使用Dense 27B或MoE 35B模型,并提供了安装和配置说明。

0 人收藏 0 人点赞
#model-inference

既然MTP已合并……你在2x3090上运行Qwen 3.6 35B的最佳输出是什么?

Reddit r/LocalLLaMA · 2026-05-16

讨论在llama.cpp中使用新MTP合并功能在双3090上运行Qwen 3.6 35B时的性能权衡,用户分享token速度并寻求最佳配置。

0 人收藏 0 人点赞
#model-inference

除了权重,GGUF 还包含什么?——以及仍缺少什么?

Hacker News Top · 2026-05-14 缓存

本文探讨了 llama.cpp 用于语言模型的 GGUF 文件格式,重点介绍了其单文件便利性以及嵌入的聊天模板和特殊令牌的作用。还比较了不同的 Jinja 实现,并讨论了该格式仍缺少哪些内容。

0 人收藏 0 人点赞
#model-inference

@jun_song: 如果我们能弄清楚如何将 MoE 模型中仅激活的参数加载到 GPU 中,而不是加载全部权重,那将是颠覆性的……

X AI KOLs Following · 2026-05-10

作者推测,如果仅将 MoE 模型的激活参数加载到 GPU 上,将能极大提高运行效率,并允许在本地运行 Kimi 这样的大型模型,尽管作者承认目前这尚不切实际。

0 人收藏 0 人点赞
#model-inference

@sanbuphy: K2.6 成功在 Mac 本地下载并部署了 Qwen3.5-0.8B 模型,通过使用小众 Zig 语言实现并优化模型推理,证明了新模型的泛化能力。经过 4,000 多次工具调用,超过 12 小时的不间断运行,K2.6 模型共迭代了 14 …

X AI KOLs Timeline · 2026-04-21 缓存

K2.6在Mac本地成功部署Qwen3.5-0.8B模型,使用Zig语言实现推理优化,经过14轮迭代将吞吐量从约15 tokens/s提升至约193 tokens/s,比LM Studio快20%。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈