decode-speed

标签

Cards List
#decode-speed

GPU热专家重载功能是社区所需

Reddit r/LocalLLaMA · 2026-09-11

请求LLaMA维护者实现一个名为'GPU热专家重载'的功能,以提高具有中等活跃参数的MOE模型的解码速度,使其在像3090这样的GPU上更易于本地使用。

0 人收藏 0 人点赞
#decode-speed

解码速度是智能体循环中无人预算的延迟代价

Reddit r/AI_Agents · 2026-07-24

讨论AI智能体循环中被忽视的解码速度延迟成本,影响整体性能。

0 人收藏 0 人点赞
#decode-speed

具体到RAG,预填充速度比解码速度更重要,以及为何Strix Halo在交互式使用中表现不佳

Reddit r/LocalLLaMA · 2026-07-03

本文解释了在RAG应用中,预填充速度比解码速度更重要,并讨论了为何AMD的Strix Halo APU在交互式使用场景中表现不佳。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈