vllm

标签

Cards List
#vllm

2400cc 推理竞速机:双RTX 3090引擎,NVLink涡轮增压,裸机7840U ThinkPad ECU,大众高尔夫散热器

Reddit r/LocalLLaMA ↗ · 1小时前

一台使用双RTX 3090 GPU、ThinkPad主板和大众高尔夫散热器自制的推理机,能够通过vLLM运行如Qwen3.8-27B等AI模型。

0 人收藏 0 人点赞
#vllm

@agenticgirl: Nokia Applied Research 开源了 WiSP,这是一个 vLLM 插件,用于在完全专家池不适合时运行 MoE 模型……

X AI KOLs Timeline ↗ · 6小时前 缓存

Nokia Applied Research 已开源 WiSP,这是一个 vLLM 插件,用于在显存不足的 GPU 上运行 MoE 模型,通过智能地对专家进行分页并利用 KV 缓存重新分配内存,实现了高达 2.0 倍的解码吞吐量提升。

0 人收藏 0 人点赞
#vllm

@PyTorch: 在 @vllm_project 中的弹性专家并行性允许您在活动的混合专家部署期间动态添加或移除GPU…

X AI KOLs Following ↗ · 8小时前 缓存

本文推广了在2026年PyTorch Conference North America上关于vLLM中弹性专家并行性的演讲,讨论了如何在混合专家部署中动态添加或移除GPU,同时最小化停机时间。

0 人收藏 0 人点赞
#vllm

让 Volta 再次快起来

Reddit r/LocalLLaMA ↗ · 22小时前

这篇文章介绍了 1Cat-vLLM,这是一个针对 NVIDIA V100 GPU 优化的 vLLM 分支,并将其性能与 llama.cpp 进行比较,用于服务像 Qwen3.6-35b 这样的大型语言模型。

0 人收藏 0 人点赞
#vllm

@PyTorch: 对优化ARM CPU上的混合专家模型LLM推理感兴趣吗?在他于PyTorch Conference North America的演讲中,…

X AI KOLs Timeline ↗ · 昨天 缓存

在PyTorch Conference North America上,来自Fujitsu Research India的Maajid Khan将发表演讲,探讨使用vLLM和OpenVINO优化ARM CPU上的混合专家模型LLM推理。

0 人收藏 0 人点赞
#vllm

Dailychained PLX 88096 交换机,四路 RTX 5070 Ti + 四路 RTX 5060 Ti

Reddit r/LocalLLaMA ↗ · 昨天

一位用户分享了使用 RTX 5070 Ti 和 5060 Ti 构建多 GPU 系统的经验,该系统用于在 Linux 上通过 vLLM 运行 Qwen3.8-27B-FP8 等 AI 模型,详细介绍了硬件设置、基准测试和挑战。

0 人收藏 0 人点赞
#vllm

vLLM中的水印

Lobsters Hottest ↗ · 昨天 缓存

本文详细介绍了vLLM中水印技术的实现,用于确定AI生成内容中的文本溯源,利用采样中的随机性来平衡无失真性、鲁棒性和速度。

0 人收藏 0 人点赞
#vllm

@norpadon: 我们已公开发布预览版:https://huggingface.co/trymirai/Qwen3.8-27B-S-experimental… Qwen3.8 27B that fi…

X AI KOLs Timeline ↗ · 2天前 缓存

Qwen3.8-27B-S-experimental 的预览版,一个使用 Mirai S 编解码器的量化 AI 模型,现已在 Hugging Face 上公开可用。它支持在 Apple Silicon 上使用 uzu 和在 NVIDIA 上使用 vLLM 进行推理,并提供性能详情和使用说明。

0 人收藏 0 人点赞
#vllm

从推理引擎到推理控制平面:连接vLLM、llm-d与高效分布式LLM服务的演进

arXiv cs.AI ↗ · 3天前 缓存

本文综合了高效分布式LLM服务的研究,将vLLM和llm-d连接为互补层,并提出一个推理执行规划器以用于未来调度器的开发。

0 人收藏 0 人点赞
#vllm

vLLM中的硬件无关模型(10分钟阅读)

TLDR AI ↗ · 3天前 缓存

vLLM正在引入硬件无关层,以在尖端硬件上的高性能与跨不同加速器的可移植性之间取得平衡,解决与torch.compile的兼容性问题。

0 人收藏 0 人点赞
#vllm

MiMo-V2.6-Flash 在 vLLM 上的更新:修复了思考与工具功能导致的“空回复”问题,并揭示了一个隐藏的 2,048 输出令牌上限。

Reddit r/LocalLLaMA ↗ · 3天前

本文针对使用vLLM部署MiMo-V2.6-Flash模型时遇到的三个错误提供识别方法与解决方案,包括流式模式下的空响应、工具循环中的推理损失,以及隐藏的token输出上限问题。

0 人收藏 0 人点赞
#vllm

@PyTorch: 如何保持 @vllm_project 以光速运行,同时不排斥在多样化硬件上运行多样化模型的用户?

X AI KOLs Following ↗ · 3天前 缓存

介绍了 vLLM 中的硬件无关层,以在确保跨多样化硬件可移植性的同时保持高性能,正如 PyTorch Foundation 博客文章中所宣布的。

0 人收藏 0 人点赞
#vllm

PyTorch:PyTorch 的发布不再仅仅是分发二进制文件。发布工程现在协调 PyTorch、Triton…

X AI KOLs Following ↗ · 3天前 缓存

本文宣布了 PyTorch Conference North America 2026,届时来自 Meta 的 Andrey Talman 将讨论 PyTorch 发布流程的现代化,包括与 Triton 和 vllm 的协调,以及 AI 代理工作流的使用。

0 人收藏 0 人点赞
#vllm

@PyTorch:前沿模型是启动AI产品的最快速途径,但当使用规模扩大时会怎样?在我们最新的案例研究中…

X AI KOLs Following ↗ · 4天前 缓存

Shopify 利用 PyTorch 和 vLLM 打造了持续学习闭环,用于优化其 GraphQL 智能体,通过生产环境驱动的更新,实现了成本降低96%,并超越了前沿模型的表现。

0 人收藏 0 人点赞
#vllm

Edge0/Audio8-ASR-Infinite

Hugging Face Models Trending ↗ · 5天前 缓存

Audio8 ASR Infinite 是一款原生流式语音识别模型,具有可选音频时钟和可配置转录延迟,支持无限长度音频转录且无漂移。

0 人收藏 0 人点赞
#vllm

@shao__meng: https://x.com/shao__meng/status/2101835798316495007

X AI KOLs Timeline ↗ · 5天前 缓存

Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。

0 人收藏 0 人点赞
#vllm

自托管推理编排器对比:LocalAI、exo、GPUStack、vLLM

Hacker News Top ↗ · 5天前 缓存

本文对截至2026年9月的自托管推理编排器在AI模型部署方面进行对比分析,涵盖多机支持、缓存感知路由和平台兼容性等功能。

0 人收藏 0 人点赞
#vllm

所以我用 Remotion 和 GLM 5.3 Flash 试了试,这家伙真的很棒。

Reddit r/LocalLLaMA ↗ · 2026-09-19

一位用户分享了使用 Remotion 和 GLM 5.3 Flash 模型生成关于股市分析的动态图形视频的积极体验,指出其有效性和未来可负担性的潜力。

0 人收藏 0 人点赞
#vllm

@XAMTO_AI:长PDF被切割成单页然后重新拼接,其中跨页表格和阅读顺序最容易……

X AI KOLs Timeline ↗ · 2026-09-19 缓存

百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。

0 人收藏 0 人点赞
#vllm

@vllm_project: 感谢所有出席、发言并在整个 vLLM Conference 中坚持的人。会谈门口排起的长队说明了…

X AI KOLs Following ↗ · 2026-09-19 缓存

vLLM Conference 成功闭幕,社区参与度高,会议记录可在讨论串中获取。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈