exllamav3

标签

Cards List
#exllamav3

Qwen3.8 flash next + ExLlamaV3 + Hermes 真是令人惊叹

Reddit r/LocalLLaMA ↗ · 4天前

用户分享了他们使用 Qwen3.8 模型配合 ExLlamaV3 在 6x3090 GPU 上的积极体验,达到了每秒 80-120 个令牌,并通过 Matrix 控制 Hermes 代理进行日常使用。

0 人收藏 0 人点赞
#exllamav3

在 RTX 3060 + 5060 Ti 上成功运行 Qwen 3.8 27B EXL3

Reddit r/LocalLLaMA ↗ · 2026-09-20

一名用户成功运行了 Qwen 3.8 27B AI 模型在 RTX 3060 和 5060 Ti GPU 的混合设置上,使用 exllamav3 的张量并行技术,在启用 MTP 的情况下达到约每秒 50 个令牌的速度。

0 人收藏 0 人点赞
#exllamav3

ExLlamaV3 被低估了

Reddit r/LocalLLaMA ↗ · 2026-09-07

作者推荐ExLlamaV3,这是一个被低估的本地AI推理工具,在NVIDIA硬件上性能优于llama.cpp,最近的更新如CPU MoE卸载提升了其性能。

0 人收藏 0 人点赞
#exllamav3

exllamav3 在我的配置下轻松击败运行 CPU 卸载 Qwen-3.8-Flash-Next 的 llama.cpp!

Reddit r/LocalLLaMA ↗ · 2026-09-07

一位用户对 exllamav3 和 llama.cpp 进行了 CPU 卸载推理的基准测试,显示 exllamav3 对于 Qwen 模型更快,但对于其他模型更慢,具体取决于硬件和模型架构。

0 人收藏 0 人点赞
#exllamav3

我移植了EXL3使其在Apple Silicon上良好运行 - PonyExl3

Reddit r/LocalLLaMA ↗ · 2026-06-15

将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。

0 人收藏 0 人点赞
#exllamav3

@0xSero:关于 LLM 推理与部署,看这一篇就够了。你听说过:- vLLM - SGLang - llama.cpp - …

X AI KOLs Timeline ↗ · 2026-04-20 缓存

vLLM、SGLang、llama.cpp 与 ExLlamaV3 等主流开源推理引擎概览,助你轻松托管并运行大模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈