v100

标签

Cards List
#v100

让 Volta 再次快起来

Reddit r/LocalLLaMA ↗ · 2天前

这篇文章介绍了 1Cat-vLLM,这是一个针对 NVIDIA V100 GPU 优化的 vLLM 分支,并将其性能与 llama.cpp 进行比较,用于服务像 Qwen3.6-35b 这样的大型语言模型。

0 人收藏 0 人点赞
#v100

Qwen3.8-Flash-Next NVFP4 第3天对4xV100的支持

Reddit r/LocalLLaMA ↗ · 2026-08-30

RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。

0 人收藏 0 人点赞
#v100

NVFP4 在 Volta 上!尽管是为 Blackwell 设计的,我让四个 2017 年的 V100 原生运行 Qwen 3.8 NVFP4,并匹配我的 6000 美元 RTX 5090。

Reddit r/LocalLLaMA ↗ · 2026-08-19

作者在使用自定义软件优化(如 QPN 内核)进行高效推理时,实现了四个 2017 年 Tesla V100 GPU 与现代 RTX 5090 在运行 Qwen 3.8 模型时的性能均等。

0 人收藏 0 人点赞
#v100

v100s上Qwen3.6 27B NVFP4达366 t/s

Reddit r/LocalLLaMA ↗ · 2026-08-11

介绍了v100-skinny,一个自定义内核库,支持在V100(sm70)GPU上进行快速NVFP4推理,在最佳情况下的抽取中为Qwen3.6 27B实现366 t/s,而结构化生成和代码生成的速度较低。

0 人收藏 0 人点赞
#v100

面向V100用户:SGLang运行Qwen+Dflash和Laguna

Reddit r/LocalLLaMA ↗ · 2026-07-27

修改SGLang以在V100 GPU上支持Qwen和Laguna模型,使用自定义的FlashAttention和Marlin内核,在4xV100硬件上获得了不错的吞吐量。

0 人收藏 0 人点赞
#v100

Chinese Hackers Latest Masterpiece with NVIDIA

Reddit r/LocalLLaMA ↗ · 2026-06-22 缓存

A DIY enthusiast created a single-slot, low-profile NVIDIA V100 GPU, showcasing custom hardware modding in the PC building community.

0 人收藏 0 人点赞
#v100

Qwen 3.6 最便宜的硬件:27B 和 35B-A3B 版本

Reddit r/LocalLLaMA ↗ · 2026-06-15

讨论运行 Qwen 3.6 模型的最便宜硬件选项,比较 RTX 3090 和 Tesla V100 GPU,并详细列出约 2000 美元系统的成本构成。

0 人收藏 0 人点赞
#v100

便宜的V100 32GB

Reddit r/LocalLLaMA ↗ · 2026-06-01

在Aliexpress上有一笔二手V100 32GB GPU的交易,价格约为526美元,包含优惠券代码。

0 人收藏 0 人点赞
#v100

我花了200英镑将数据中心GPU装进我的游戏PC

Lobsters Hottest ↗ · 2026-05-31 缓存

一位博主描述了他们如何以150英镑的价格购得一块Tesla V100 SXM2数据中心GPU,并使用定制转接器将其与RTX 4080一起安装到自己的游戏PC中,实现了总计32GB的显存,并能够以每秒32个token的速度本地推理27B参数模型。

0 人收藏 0 人点赞
#v100

有人在他们的 V100 上使用 Flash Attention 2 (ai-bond) 吗?性能如何?

Reddit r/LocalLLaMA ↗ · 2026-05-29

一位用户对 Flash Attention 2 的 V100 兼容端口进行了基准测试,报告称相比默认的 PyTorch 注意力机制,速度提升了 3 到 17 倍,内存减少了高达 94%。

0 人收藏 0 人点赞
#v100

在 V100 上使用 Qwen3.6 27B 实现每秒 1000 tokens 生成

Reddit r/LocalLLaMA ↗ · 2026-05-25

在 V100 GPU 上,使用 Qwen3.6 27B 模型,通过 128 个并发请求实现了每秒 1000 tokens 的生成速度,单用户下为 80 t/s。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈