vllm

标签

Cards List
#vllm

@XAMTO_AI:长PDF被切割成单页然后重新拼接,其中跨页表格和阅读顺序最容易……

X AI KOLs Timeline ↗ · 2026-09-19 缓存

百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。

0 人收藏 0 人点赞
#vllm

@vllm_project: 感谢所有出席、发言并在整个 vLLM Conference 中坚持的人。会谈门口排起的长队说明了…

X AI KOLs Following ↗ · 2026-09-19 缓存

vLLM Conference 成功闭幕,社区参与度高,会议记录可在讨论串中获取。

0 人收藏 0 人点赞
#vllm

还在 Jev 等候名单上吗?我托管了 OpenJev,免费使用,快去试试吧!

Reddit r/LocalLLaMA ↗ · 2026-09-18

OpenJev 是一个开源服务器,提供与 TypeSafe 的 Jev 兼容的免费 API,用于概率预测,性能基准显示其延迟具有竞争力。

0 人收藏 0 人点赞
#vllm

在单张 AMD Radeon R9700 上运行 Qwen3.8 27b NVFP4 达 153 tok/s,8 并发请求下 470 tok/s,预填充速度 3,619 tok/s

Reddit r/LocalLLaMA ↗ · 2026-09-17

优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。

0 人收藏 0 人点赞
#vllm

我们打造了一款开源GPU性能分析工具,可直接将AI代理指向其中,省去手动解析追踪记录的麻烦。

Reddit r/LocalLLaMA ↗ · 2026-09-17

本文介绍了一款开源GPU性能分析工具,它能以JSON格式提供性能指标数据,帮助AI代理自动完成针对vLLM、SGLang等基于CUDA的AI引擎的性能调优,无需人工进行手动轨迹分析。

0 人收藏 0 人点赞
#vllm

@JiaZhihao: 我认为这归结为一个经典的系统权衡:通用性与专业化。vLLM/SGLang 覆盖了巨大的…空间

X AI KOLs Timeline ↗ · 2026-09-16 缓存

这篇文章讨论了AI推理引擎中通用性与专业化的权衡,以vLLM和SGLang为例,并指出编码代理正在降低创建专用引擎的工程成本。

0 人收藏 0 人点赞
#vllm

您可以将Qwen3.8-Flash-Next模型的大部分KV缓存卸载到RAM中,而不会明显影响解码速度。 在使用8bit量化的Qwen3.8-Flash-Next模型时,KV缓存大小约为每token 12.5MB。通过将大部分KV缓存从显存移至RAM,并只在显存中保留少量热数据,可以显著扩大显存能够支持的上下文长度。这种混合存储方式仅会增加约1.2ms的延迟,对实际推理速度影响微乎其微,为处理超长上下文提供了一种高效且低成本的解决方案。

Reddit r/LocalLLaMA ↗ · 2026-09-16

演示了将Qwen3.8-Flash-Next模型的KV缓存卸载至系统内存的技术,通过利用该模型高效架构,可在最大程度减少解码速度下降的情况下支持长上下文推理。

0 人收藏 0 人点赞
#vllm

先校准,再路由:面向分离式LLM服务的学习型请求路由实测研究

arXiv cs.AI ↗ · 2026-09-16 缓存

本文针对分离式LLM服务的学习型请求路由进行了实测研究,评估了一种利用准入时特征分配请求的校准路由器,在实际vLLM/NIXL集群上取得了比传统方法更高的平均有效吞吐量。

0 人收藏 0 人点赞
#vllm

@yifandotqiao: 是的,TPU。因为它在那里。

X AI KOLs Timeline ↗ · 2026-09-15 缓存

Google Cloud 与 Inferact 宣布合作优化 vLLM for TPU,使其成为开放模型生态系统中代理生产服务的一流选择。

0 人收藏 0 人点赞
#vllm

我刚刚从MacBook M5 pro 48 GB换到了RTX3090

Reddit r/LocalLLaMA ↗ · 2026-09-13

一位软件开发者分享了从MacBook换到RTX3090 Linux设置来运行AI模型的经历,使用Qwen 3.8 27B实现了显著更高的推理速度,并可能取代他的Claude订阅。

0 人收藏 0 人点赞
#vllm

我使用vLLM构建了一个LoRA适配器的无服务器托管平台

Reddit r/LocalLLaMA ↗ · 2026-09-13

Lorivo是一个无服务器平台,允许共享GPU服务器来托管多个LoRA适配器,简化部署并降低微调AI模型的成本。

0 人收藏 0 人点赞
#vllm

@ethantsliu: LLMs能够为长上下文自主控制注意力!在文本生成过程中,LLMs通常读取完整的KV缓存……

X AI KOLs Timeline ↗ · 2026-09-12 缓存

该论文介绍了声明式注意力技术,LLMs明确声明需要关注哪些上下文段,从而将令牌使用量最多减少52%,同时准确率下降极小。

0 人收藏 0 人点赞
#vllm

@PyTorch:在2026年PyTorch北美大会上,@MistralAI研究工程师、vLLM维护者Nicolò Lucchesi将展示……

X AI KOLs Timeline ↗ · 2026-09-11 缓存

Nicolò Lucchesi将在2026年PyTorch北美大会上,介绍与AWS和RedHat合作的关于vLLM中面向混合模型的解耦服务演进的成果。

0 人收藏 0 人点赞
#vllm

@Kay2289123: 分享一份最近整理的AI基础设施入门阅读清单——建议收藏并慢慢阅读……

X AI KOLs Timeline ↗ · 2026-09-11 缓存

这篇文章分享了一份精选的AI基础设施入门阅读清单,重点关注大型模型推理主题,如vLLM、连续批处理和性能基准测试。

0 人收藏 0 人点赞
#vllm

@PyTorch:在PyTorch Conference North America上,vLLM Omni团队技术负责人Ricardo Noriega de Soto和Alexander Brooks,Pr…

X AI KOLs Timeline ↗ · 2026-09-09 缓存

在PyTorch Conference North America上,Ricardo Noriega de Soto和Alexander Brooks将演示如何将vLLM的前缀缓存机制扩展到多阶段流水线,以提升推理速度并减少GPU内存开销,为优化复杂AI工作负载提供实用策略。

0 人收藏 0 人点赞
#vllm

DeepSeek-V4-Flash-Vision-Exp (285B MoE) 在 10-12 张 RTX 3090 上 — 推测解码,视觉

Reddit r/LocalLLaMA ↗ · 2026-09-09

在 10-12 张 RTX 3090 GPU 上运行 DeepSeek-V4-Flash-Vision-Exp 285B MoE 模型,可实现超过 60-120 tok/s 的解码速度,支持视觉和工具调用,文档完整,便于重现。

0 人收藏 0 人点赞
#vllm

接受长度越高,文本越慢:Ling在单台Spark上的n=1/2/3 MTP测试

Reddit r/LocalLLaMA ↗ · 2026-09-07

对Ling-3.0-flash的基准测试显示,在多令牌预测中,更高的接受长度会降低文本吞吐量,其中n=1是所评估工作负载中最高效的设置。

0 人收藏 0 人点赞
#vllm

验证本地 LLM 宣称的 KV 缓存能否承受真实压力;精确观察旧上下文如何被逐出缓存

Reddit r/LocalLLaMA ↗ · 2026-09-06

作者发布了一款名为 cache-pressure 的开源工具,用于基准测试本地 LLM 推理引擎在压力下的 KV 缓存上下文保留能力,帮助用户验证实际缓存容量与宣传指标是否一致。

0 人收藏 0 人点赞
#vllm

@QuixiAI: DGX Spark 的 NVIDIA 开源内核驱动迎来两项修复——进程退出时,释放的 GPU 内存现已归还操作系统……

X AI KOLs Timeline ↗ · 2026-09-05

DGX Spark 的 NVIDIA 开源内核驱动迎来两项修复:进程退出时释放的 GPU 内存将归还操作系统,同时为 GPU 访问系统内存产生的缺页异常启用大页机制,首次访问带宽从 0.4 提升至 19.6 GiB/s。

0 人收藏 0 人点赞
#vllm

@PyTorch:TorchSpec 是一个用于训练推测解码草稿模型的 PyTorch 原生框架。本次发布,一项合作...

X AI KOLs Following ↗ · 2026-09-03 缓存

TorchSpec 是一个用于训练推测解码草稿模型的 PyTorch 原生框架,与 vllm 合作发布,并在 NVIDIA GB200 硬件上使用 Kimi K3 草稿模型进行了演示。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈