标签
一项在单张 RTX 3090 上进行的实测基准显示:当 MoE 模型能够放入显存时,llama.cpp 快 2-3 倍,且首个 token 输出明显更快;而当运行超出显存容量的 gpt-oss-120b(63 GB)时,FreeToken 在 32 个并发用户下的首 token 时间(time-to-first-token)快 7 倍。
一篇讲解 LLM 服务调度循环的教学文章,解释推理请求如何经过等待队列、批量构建、prefill、decode 和 continuous batching,使 GPU 在不同请求先后完成时仍保持满载运行。
一位用户分享了一个变通方案:通过用零填充模型架构维度直到能被整除,让 vLLM 在六块 GPU 上实现张量并行(tp=6),从而在 Radeon 7900 XTX 显卡上运行 Qwen 27B 推理时获得更高的 KV cache 利用率。
Strata 是一款开源工具,可通过量化在消费级游戏 PC 上运行拥有 1250 亿参数的 Qwen3.8-Flash-Next 模型,在 AMD RX 7900 XTX 上实现 52-60 tokens/s,在 RTX 5070 上实现 60-95 tokens/s,并通过 k8v4 等 KV Cache 优化额外提速 10%。
这条推文强调了一个优化版本的Qwen 3.8模型,该模型可以在显存低于16GB的本地硬件上高效运行,在较旧的GPU配置上达到30-80个令牌每秒的速度。
作者发现,在3张3090显卡上使用Exllama3以3.05 bpw运行Qwen 3.8 Next Flash,能为本地LLM使用提供卓越的性能和质量,优于其他量化方法。
本文探讨了不同候选生成计划对大语言模型在测试时扩展过程中的能耗和性能的影响,表明更大的批次大小可以减少能耗和延迟。
一名用户正在使用 NVIDIA 5070 Ti GPU 测试新发布的 Ternary Bonsai 2 27B AI 模型,这是 Qwen3.8 27B 的更小且量化版本,并对其性能感到印象深刻。
Magine从一个简单的GitHub个人资料生成器演变为一个AI代理平台,具备视觉驱动代理和分布式GPU网格,包括增长指标和代理编排的技术创新。
本文展示了Gemma 4模型在GPU和Jetson Orin硬件上的语音对话,使用开源的Cortexist Little Gemma引擎实现高效推理,并支持口型同步和手势。
一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。
一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。
一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。
本文在24GB GPU上对Qwen3.8-27B、Qwen3.6-27B和Gemma 4 31B的性能进行了基准测试和比较,推荐Qwen3.8-27B作为大多数用户的最佳默认选择,因其具备更优的编码和推理能力。
Qwen3.8-27B是一款新AI模型,在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max等前沿模型性能相当,并且可以在RTX 3090 GPU上本地运行。
一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。
这篇文章质疑在资源有限的系统上运行的 Qwen 3.5 9B 是否能超越 GPT-4o,突出了其小于 7 GB 的小巧尺寸和声称的优越性能。
ABot-World-0是一个实时交互的世界模型,在单个NVIDIA RTX 5090 GPU上以19GB显存实现了720p分辨率、16FPS的视频生成,支持无限的动作条件世界展开,用于模拟和AI研究。
对英伟达 CMP170HX 矿卡改作 64GB 显存 AI 推理加速器的实测基准测试,表明它们能以可用速度运行大型本地 LLM(如 DeepSeek V4-Flash 和 gpt-oss-120B),但存在 Ampere 级吞吐量和 PCIe Gen2 x4 连接方面的注意事项。
Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。