vllm

标签

Cards List
#vllm

@PyTorch: 对优化ARM CPU上的混合专家模型LLM推理感兴趣吗?在他于PyTorch Conference North America的演讲中,…

X AI KOLs Timeline ↗ · 3小时前 缓存

在PyTorch Conference North America上,来自Fujitsu Research India的Maajid Khan将发表演讲,探讨使用vLLM和OpenVINO优化ARM CPU上的混合专家模型LLM推理。

0 人收藏 0 人点赞
#vllm

Dailychained PLX 88096 交换机,四路 RTX 5070 Ti + 四路 RTX 5060 Ti

Reddit r/LocalLLaMA ↗ · 15小时前

一位用户分享了使用 RTX 5070 Ti 和 5060 Ti 构建多 GPU 系统的经验,该系统用于在 Linux 上通过 vLLM 运行 Qwen3.8-27B-FP8 等 AI 模型,详细介绍了硬件设置、基准测试和挑战。

0 人收藏 0 人点赞
#vllm

vLLM中的水印

Lobsters Hottest ↗ · 17小时前 缓存

本文详细介绍了vLLM中水印技术的实现,用于确定AI生成内容中的文本溯源,利用采样中的随机性来平衡无失真性、鲁棒性和速度。

0 人收藏 0 人点赞
#vllm

@norpadon: 我们已公开发布预览版:https://huggingface.co/trymirai/Qwen3.8-27B-S-experimental… Qwen3.8 27B that fi…

X AI KOLs Timeline ↗ · 22小时前 缓存

Qwen3.8-27B-S-experimental 的预览版,一个使用 Mirai S 编解码器的量化 AI 模型,现已在 Hugging Face 上公开可用。它支持在 Apple Silicon 上使用 uzu 和在 NVIDIA 上使用 vLLM 进行推理,并提供性能详情和使用说明。

0 人收藏 0 人点赞
#vllm

从推理引擎到推理控制平面:连接vLLM、llm-d与高效分布式LLM服务的演进

arXiv cs.AI ↗ · 2天前 缓存

本文综合了高效分布式LLM服务的研究,将vLLM和llm-d连接为互补层,并提出一个推理执行规划器以用于未来调度器的开发。

0 人收藏 0 人点赞
#vllm

vLLM中的硬件无关模型(10分钟阅读)

TLDR AI ↗ · 2天前 缓存

vLLM正在引入硬件无关层,以在尖端硬件上的高性能与跨不同加速器的可移植性之间取得平衡,解决与torch.compile的兼容性问题。

0 人收藏 0 人点赞
#vllm

MiMo-V2.6-Flash 在 vLLM 上的更新:修复了思考与工具功能导致的“空回复”问题,并揭示了一个隐藏的 2,048 输出令牌上限。

Reddit r/LocalLLaMA ↗ · 2天前

本文针对使用vLLM部署MiMo-V2.6-Flash模型时遇到的三个错误提供识别方法与解决方案,包括流式模式下的空响应、工具循环中的推理损失,以及隐藏的token输出上限问题。

0 人收藏 0 人点赞
#vllm

@PyTorch: 如何保持 @vllm_project 以光速运行,同时不排斥在多样化硬件上运行多样化模型的用户?

X AI KOLs Following ↗ · 2天前 缓存

介绍了 vLLM 中的硬件无关层,以在确保跨多样化硬件可移植性的同时保持高性能,正如 PyTorch Foundation 博客文章中所宣布的。

0 人收藏 0 人点赞
#vllm

PyTorch:PyTorch 的发布不再仅仅是分发二进制文件。发布工程现在协调 PyTorch、Triton…

X AI KOLs Following ↗ · 2天前 缓存

本文宣布了 PyTorch Conference North America 2026,届时来自 Meta 的 Andrey Talman 将讨论 PyTorch 发布流程的现代化,包括与 Triton 和 vllm 的协调,以及 AI 代理工作流的使用。

0 人收藏 0 人点赞
#vllm

@PyTorch:前沿模型是启动AI产品的最快速途径,但当使用规模扩大时会怎样?在我们最新的案例研究中…

X AI KOLs Following ↗ · 2天前 缓存

Shopify 利用 PyTorch 和 vLLM 打造了持续学习闭环,用于优化其 GraphQL 智能体,通过生产环境驱动的更新,实现了成本降低96%,并超越了前沿模型的表现。

0 人收藏 0 人点赞
#vllm

Edge0/Audio8-ASR-Infinite

Hugging Face Models Trending ↗ · 3天前 缓存

Audio8 ASR Infinite 是一款原生流式语音识别模型,具有可选音频时钟和可配置转录延迟,支持无限长度音频转录且无漂移。

0 人收藏 0 人点赞
#vllm

@shao__meng: https://x.com/shao__meng/status/2101835798316495007

X AI KOLs Timeline ↗ · 4天前 缓存

Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。

0 人收藏 0 人点赞
#vllm

自托管推理编排器对比:LocalAI、exo、GPUStack、vLLM

Hacker News Top ↗ · 4天前 缓存

本文对截至2026年9月的自托管推理编排器在AI模型部署方面进行对比分析,涵盖多机支持、缓存感知路由和平台兼容性等功能。

0 人收藏 0 人点赞
#vllm

所以我用 Remotion 和 GLM 5.3 Flash 试了试,这家伙真的很棒。

Reddit r/LocalLLaMA ↗ · 5天前

一位用户分享了使用 Remotion 和 GLM 5.3 Flash 模型生成关于股市分析的动态图形视频的积极体验,指出其有效性和未来可负担性的潜力。

0 人收藏 0 人点赞
#vllm

@XAMTO_AI:长PDF被切割成单页然后重新拼接,其中跨页表格和阅读顺序最容易……

X AI KOLs Timeline ↗ · 6天前 缓存

百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。

0 人收藏 0 人点赞
#vllm

@vllm_project: 感谢所有出席、发言并在整个 vLLM Conference 中坚持的人。会谈门口排起的长队说明了…

X AI KOLs Following ↗ · 6天前 缓存

vLLM Conference 成功闭幕,社区参与度高,会议记录可在讨论串中获取。

0 人收藏 0 人点赞
#vllm

还在 Jev 等候名单上吗?我托管了 OpenJev,免费使用,快去试试吧!

Reddit r/LocalLLaMA ↗ · 2026-09-18

OpenJev 是一个开源服务器,提供与 TypeSafe 的 Jev 兼容的免费 API,用于概率预测,性能基准显示其延迟具有竞争力。

0 人收藏 0 人点赞
#vllm

在单张 AMD Radeon R9700 上运行 Qwen3.8 27b NVFP4 达 153 tok/s,8 并发请求下 470 tok/s,预填充速度 3,619 tok/s

Reddit r/LocalLLaMA ↗ · 2026-09-17

优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。

0 人收藏 0 人点赞
#vllm

我们打造了一款开源GPU性能分析工具,可直接将AI代理指向其中,省去手动解析追踪记录的麻烦。

Reddit r/LocalLLaMA ↗ · 2026-09-17

本文介绍了一款开源GPU性能分析工具,它能以JSON格式提供性能指标数据,帮助AI代理自动完成针对vLLM、SGLang等基于CUDA的AI引擎的性能调优,无需人工进行手动轨迹分析。

0 人收藏 0 人点赞
#vllm

@JiaZhihao: 我认为这归结为一个经典的系统权衡:通用性与专业化。vLLM/SGLang 覆盖了巨大的…空间

X AI KOLs Timeline ↗ · 2026-09-16 缓存

这篇文章讨论了AI推理引擎中通用性与专业化的权衡,以vLLM和SGLang为例,并指出编码代理正在降低创建专用引擎的工程成本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈