gpu-inference

标签

Cards List
#gpu-inference

FreeToken 与 llama.cpp 在单张 RTX 3090 上的对比:当 MoE 模型能装进显存时,llama.cpp 快 2–3 倍;而在 gpt-oss-120b(63 GB)上,FreeToken 在 32 个并发用户时首个 token 快 7 倍。

Reddit r/LocalLLaMA ↗ · 7小时前 缓存

一项在单张 RTX 3090 上进行的实测基准显示:当 MoE 模型能够放入显存时,llama.cpp 快 2-3 倍,且首个 token 输出明显更快;而当运行超出显存容量的 gpt-oss-120b(63 GB)时,FreeToken 在 32 个并发用户下的首 token 时间(time-to-first-token)快 7 倍。

0 人收藏 0 人点赞
#gpu-inference

@_avichawla:LLM 调度循环,清晰讲解:(收藏这篇)每当用户向 LLM 发送一个 prompt,生成的推……

X AI KOLs Timeline ↗ · 13小时前 缓存

一篇讲解 LLM 服务调度循环的教学文章,解释推理请求如何经过等待队列、批量构建、prefill、decode 和 continuous batching,使 GPU 在不同请求先后完成时仍保持满载运行。

0 人收藏 0 人点赞
#gpu-inference

tp=6 在 vLLM 上也可行,只需填充补位

Reddit r/LocalLLaMA ↗ · 20小时前

一位用户分享了一个变通方案:通过用零填充模型架构维度直到能被整除,让 vLLM 在六块 GPU 上实现张量并行(tp=6),从而在 Radeon 7900 XTX 显卡上运行 Qwen 27B 推理时获得更高的 KV cache 利用率。

0 人收藏 0 人点赞
#gpu-inference

@coldniko:在 8GB+ AMD 显卡 RX 7900 XTX 上运行 Qwen3.8-Flash-next,模型可持续输出 52-60 tokens/s + 1250 …

X AI KOLs Timeline ↗ · 2天前 缓存

Strata 是一款开源工具,可通过量化在消费级游戏 PC 上运行拥有 1250 亿参数的 Qwen3.8-Flash-Next 模型,在 AMD RX 7900 XTX 上实现 52-60 tokens/s,在 RTX 5070 上实现 60-95 tokens/s,并通过 k8v4 等 KV Cache 优化额外提速 10%。

0 人收藏 0 人点赞
#gpu-inference

@DavidFSWD: 本周本地AI最惊人的事是这个优化过的Qwen 3.8模型:ukisai/Swift-1.5-Qwen3.8-27B-GSQ-RCO-GGUF…

X AI KOLs Timeline ↗ · 5天前 缓存

这条推文强调了一个优化版本的Qwen 3.8模型,该模型可以在显存低于16GB的本地硬件上高效运行,在较旧的GPU配置上达到30-80个令牌每秒的速度。

0 人收藏 0 人点赞
#gpu-inference

致所有使用3x 3090进行本地LLM的朋友——我找到了目前最佳方案

Reddit r/LocalLLaMA ↗ · 2026-09-20

作者发现,在3张3090显卡上使用Exllama3以3.05 bpw运行Qwen 3.8 Next Flash,能为本地LLM使用提供卓越的性能和质量,优于其他量化方法。

0 人收藏 0 人点赞
#gpu-inference

候选数量不足:候选生成策略影响LLM测试时扩展的能耗与性能

arXiv cs.LG ↗ · 2026-09-18 缓存

本文探讨了不同候选生成计划对大语言模型在测试时扩展过程中的能耗和性能的影响,表明更大的批次大小可以减少能耗和延迟。

0 人收藏 0 人点赞
#gpu-inference

@BenjaminDEKR: 我现在正在用一块 5070 Ti(16GB 显存)进行测试,目前的表现真的非常令人印象深刻。

X AI KOLs Following ↗ · 2026-09-18 缓存

一名用户正在使用 NVIDIA 5070 Ti GPU 测试新发布的 Ternary Bonsai 2 27B AI 模型,这是 Qwen3.8 27B 的更小且量化版本,并对其性能感到印象深刻。

0 人收藏 0 人点赞
#gpu-inference

它起初是一个GitHub个人资料生成器。然后意外地交易了股票。现在它是一个AI代理平台。

Reddit r/AI_Agents ↗ · 2026-09-13

Magine从一个简单的GitHub个人资料生成器演变为一个AI代理平台,具备视觉驱动代理和分布式GPU网格,包括增长指标和代理编排的技术创新。

0 人收藏 0 人点赞
#gpu-inference

Gemma4 12B与E2B在GPU和Jetson Orin上的语音对话

Reddit r/LocalLLaMA ↗ · 2026-09-08

本文展示了Gemma 4模型在GPU和Jetson Orin硬件上的语音对话,使用开源的Cortexist Little Gemma引擎实现高效推理,并支持口型同步和手势。

0 人收藏 0 人点赞
#gpu-inference

(NInfer分支) 我为Qwen-3.8 27B在双5090显卡上实现1M上下文的尝试

Reddit r/LocalLLaMA ↗ · 2026-08-29

一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。

0 人收藏 0 人点赞
#gpu-inference

大家忽略了 Qwen 3.8 27B Q2 + Q2 DFlash + Q5 KV 的实力

Reddit r/LocalLLaMA ↗ · 2026-08-28

一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。

0 人收藏 0 人点赞
#gpu-inference

Qwen 3.8 27B 比预期更快

Reddit r/LocalLLaMA ↗ · 2026-08-18

一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。

0 人收藏 0 人点赞
#gpu-inference

Qwen3.8 vs Qwen3.6 vs Gemma 4 在24GB GPU上的对比(阅读时长约10分钟)

TLDR AI ↗ · 2026-08-18 缓存

本文在24GB GPU上对Qwen3.8-27B、Qwen3.6-27B和Gemma 4 31B的性能进行了基准测试和比较,推荐Qwen3.8-27B作为大多数用户的最佳默认选择,因其具备更优的编码和推理能力。

0 人收藏 0 人点赞
#gpu-inference

Qwen3.8-27B在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max并驾齐驱。您现在只需一块RTX 3090就能运行一个接近前沿的模型。

Reddit r/singularity ↗ · 2026-08-17 缓存

Qwen3.8-27B是一款新AI模型,在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max等前沿模型性能相当,并且可以在RTX 3090 GPU上本地运行。

0 人收藏 0 人点赞
#gpu-inference

价值100美元的GPU以7.39 t/s运行Qwen 3.8 27b模型

Reddit r/LocalLLaMA ↗ · 2026-08-17

一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。

0 人收藏 0 人点赞
#gpu-inference

你认为这有多准确?Qwen3.5 9B 对比 GPT-4o

Reddit r/LocalLLaMA ↗ · 2026-08-17

这篇文章质疑在资源有限的系统上运行的 Qwen 3.5 9B 是否能超越 GPT-4o,突出了其小于 7 GB 的小巧尺寸和声称的优越性能。

0 人收藏 0 人点赞
#gpu-inference

Genie风格的可交互世界模型,在单个5090上以19GB显存运行720p分辨率、16FPS

Reddit r/LocalLLaMA ↗ · 2026-08-16 缓存

ABot-World-0是一个实时交互的世界模型,在单个NVIDIA RTX 5090 GPU上以19GB显存实现了720p分辨率、16FPS的视频生成,支持无限的动作条件世界展开,用于模拟和AI研究。

0 人收藏 0 人点赞
#gpu-inference

我实测了 CMP170HX

Reddit r/LocalLLaMA ↗ · 2026-08-11

对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。

0 人收藏 0 人点赞
#gpu-inference

@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……

X AI KOLs Following ↗ · 2026-08-08 缓存

Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈