标签
百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。
vLLM Conference 成功闭幕,社区参与度高,会议记录可在讨论串中获取。
OpenJev 是一个开源服务器,提供与 TypeSafe 的 Jev 兼容的免费 API,用于概率预测,性能基准显示其延迟具有竞争力。
优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。
本文介绍了一款开源GPU性能分析工具,它能以JSON格式提供性能指标数据,帮助AI代理自动完成针对vLLM、SGLang等基于CUDA的AI引擎的性能调优,无需人工进行手动轨迹分析。
这篇文章讨论了AI推理引擎中通用性与专业化的权衡,以vLLM和SGLang为例,并指出编码代理正在降低创建专用引擎的工程成本。
演示了将Qwen3.8-Flash-Next模型的KV缓存卸载至系统内存的技术,通过利用该模型高效架构,可在最大程度减少解码速度下降的情况下支持长上下文推理。
本文针对分离式LLM服务的学习型请求路由进行了实测研究,评估了一种利用准入时特征分配请求的校准路由器,在实际vLLM/NIXL集群上取得了比传统方法更高的平均有效吞吐量。
Google Cloud 与 Inferact 宣布合作优化 vLLM for TPU,使其成为开放模型生态系统中代理生产服务的一流选择。
一位软件开发者分享了从MacBook换到RTX3090 Linux设置来运行AI模型的经历,使用Qwen 3.8 27B实现了显著更高的推理速度,并可能取代他的Claude订阅。
Lorivo是一个无服务器平台,允许共享GPU服务器来托管多个LoRA适配器,简化部署并降低微调AI模型的成本。
该论文介绍了声明式注意力技术,LLMs明确声明需要关注哪些上下文段,从而将令牌使用量最多减少52%,同时准确率下降极小。
Nicolò Lucchesi将在2026年PyTorch北美大会上,介绍与AWS和RedHat合作的关于vLLM中面向混合模型的解耦服务演进的成果。
这篇文章分享了一份精选的AI基础设施入门阅读清单,重点关注大型模型推理主题,如vLLM、连续批处理和性能基准测试。
在PyTorch Conference North America上,Ricardo Noriega de Soto和Alexander Brooks将演示如何将vLLM的前缀缓存机制扩展到多阶段流水线,以提升推理速度并减少GPU内存开销,为优化复杂AI工作负载提供实用策略。
在 10-12 张 RTX 3090 GPU 上运行 DeepSeek-V4-Flash-Vision-Exp 285B MoE 模型,可实现超过 60-120 tok/s 的解码速度,支持视觉和工具调用,文档完整,便于重现。
对Ling-3.0-flash的基准测试显示,在多令牌预测中,更高的接受长度会降低文本吞吐量,其中n=1是所评估工作负载中最高效的设置。
作者发布了一款名为 cache-pressure 的开源工具,用于基准测试本地 LLM 推理引擎在压力下的 KV 缓存上下文保留能力,帮助用户验证实际缓存容量与宣传指标是否一致。
DGX Spark 的 NVIDIA 开源内核驱动迎来两项修复:进程退出时释放的 GPU 内存将归还操作系统,同时为 GPU 访问系统内存产生的缺页异常启用大页机制,首次访问带宽从 0.4 提升至 19.6 GiB/s。
TorchSpec 是一个用于训练推测解码草稿模型的 PyTorch 原生框架,与 vllm 合作发布,并在 NVIDIA GB200 硬件上使用 Kimi K3 草稿模型进行了演示。