gpu-inference

标签

Cards List
#gpu-inference

自托管Kimi K3:硬件成本增加20%,任务解决能力提升20%

Hacker News Top ↗ · 2026-07-29 缓存

最新基准测试显示,在8个B300节点上自托管Kimi K3实现了86.4%的任务解决率,硬件成本大约比在B200节点上运行的GLM-5.2高出20%,尽管吞吐量较低。

0 人收藏 0 人点赞
#gpu-inference

Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s

Reddit r/LocalLLaMA ↗ · 2026-07-27

Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。

0 人收藏 0 人点赞
#gpu-inference

@sudoingX:每天都有人问我如何在理论上跑不动的硬件上运行bonsai 27b。所以这里全部内容在此……

X AI KOLs Timeline ↗ · 2026-07-20 缓存

一份详细指南,介绍如何在仅有8GB显存的硬件上运行27B Bonsai模型,使用1位量化版本和PrismML分支的llama.cpp,包含精确的服务器命令和配置。

0 人收藏 0 人点赞
#gpu-inference

利用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理

arXiv cs.LG ↗ · 2026-07-13 缓存

本文提出了一种针对具有适度非结构化稀疏性的大语言模型的高效GPU推理方法。引入了一种三层矩阵存储格式和一个联合利用稀疏张量核心与CUDA核心的SpMM内核,实现了相比SpInfer最高1.64倍的内核级加速,以及相比FlashLLM最高1.41倍的端到端加速。

0 人收藏 0 人点赞
#gpu-inference

在4块RTX 5060 Ti上,使用P2P和PP=4,对新的unslooth/Qwen3.6-27B-NVFP4在并发数为1、4、8、12和16下的基准测试

Reddit r/LocalLLaMA ↗ · 2026-07-11

unslooth/Qwen3.6-27B-NVFP4模型在4块RTX 5060 Ti GPU上,使用点对点(P2P)和流水线并行(PP)在不同并发级别下的基准测试结果。

0 人收藏 0 人点赞
#gpu-inference

@Tono_Ken3: 在GPU上驱动Qwen3.6-27b(100 TPS),同时在CPU上驱动Hy3-299B(25 TPS),本地LLM推理计算新时代的曙光…

X AI KOLs Timeline ↗ · 2026-07-08

演示同时在GPU上以100 TPS运行Qwen3.6-27b,在CPU上以25 TPS运行Hy3-299B,标志着本地LLM推理的一个里程碑。

0 人收藏 0 人点赞
#gpu-inference

6x P40运行Minimax M2.7_Q3_XL

Reddit r/LocalLLaMA ↗ · 2026-07-02

一个详细的家庭实验室搭建方案,配备6块P40 GPU运行量化后的MiniMax M2.7模型,包含硬件规格、基准测试结果以及使用llama.cpp的最佳配置。

0 人收藏 0 人点赞
#gpu-inference

Qwen3.6-35B-A3B APEX 在单张 RTX 3090 上——充分发挥其潜力

Reddit r/LocalLLaMA ↗ · 2026-06-22

在 RTX 3090 上运行 Qwen3.6-35B-A3B APEX 模型的详细指南:比较两个 llama.cpp 分支及量化方法,以达到最佳速度与质量。

0 人收藏 0 人点赞
#gpu-inference

@Akashi203: 我开源了 AutoMegaKernel —— 将任意 HuggingFace 模型编译成一个持久的单一兆核,batch-1 解码带宽受限……

X AI KOLs Timeline ↗ · 2026-06-17 缓存

AutoMegaKernel 是一个开源代理框架,能将任意 HuggingFace 模型编译成一个持久的单一兆核(megakernel),将整个前向传播融合到一次 GPU 启动中,从而减少开销。在 L4 和 L40S 等推理级 GPU 上,它相比使用 CUDA Graph 的 cuBLAS 实现了最高 1.33 倍的加速,同时保证调度没有死锁和竞争条件。

0 人收藏 0 人点赞
#gpu-inference

@PyTorch:ExecuTorch 现有一个 MLX 委托,可在 Apple Silicon GPU 上运行 PyTorch 模型。它支持大语言模型、语音转文字、以及……

X AI KOLs Following ↗ · 2026-05-18 缓存

ExecuTorch 现有一个 MLX 委托,可在 Apple Silicon Mac 上为 PyTorch 模型提供 GPU 加速推理,支持大语言模型、语音转文字以及通过 TorchAO 进行量化的 MoE 模型。

0 人收藏 0 人点赞
#gpu-inference

qwen3.6 突然中断

Reddit r/LocalLLaMA ↗ · 2026-05-13

用户报告在使用 vLLM 配合特定 Docker 配置及投机解码(speculative decoding)部署 Qwen 3.6 模型时,模型会在任务中途停止生成。

0 人收藏 0 人点赞
#gpu-inference

在 2x3090 NVLINK 上对 Qwen 3.6 27B MTP 进行基准测试

Reddit r/LocalLLaMA ↗ · 2026-05-08

对 Qwen 3.6 27B MTP 在 4 张 RTX 3090 GPU 上的基准分析表明,基于 NVLink 的张量并行相较于 PCIe 配置可实现显著的吞吐量提升(最高达 +53%)。

0 人收藏 0 人点赞
#gpu-inference

@anyscalecompute:在本节课中,您将学到:- 使用Ray构建和扩展数据管道 - 什么是视频数据筛选 - 大规模流式传输…

X AI KOLs Following ↗ · 2026-05-07 缓存

Anyscale正在举办一场动手虚拟实验室课程,教授开发者如何使用Ray构建和扩展数据管道,涵盖视频数据筛选、分布式GPU推理以及CPU/GPU流式管道。

0 人收藏 0 人点赞
#gpu-inference

@iotcoi:Qwen3.6-27B-FP8 + Dflash + DDTree,256k 上下文,10 个智能体,单颗 49W GB10 上峰值 200 tokens/s,平均解码 136 tokens/s

X AI KOLs Timeline ↗ · 2026-04-22 缓存

量化版 27B Qwen3.6 在单颗 49W GB10 GPU 上借助 Dflash+DDTree 优化,256k 上下文、10 智能体并发,峰值达 200 tok/s,平均 136 tok/s。

0 人收藏 0 人点赞
#gpu-inference

@ProTekkFZS:在 3090 上用 Q4_K_M 3.6 35B、768k 上下文加 YaRN,爽到飞起

X AI KOLs Following ↗ · 2026-04-20 缓存

用户报告称,通过 llama.cpp 分支,在 RTX 3090 上成功以 Q4_K_M 量化运行 35B 参数 MoE 模型,上下文长达 768K,仅把 8 个专家卸载到 CPU,性能依旧可接受。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈