serving-optimization

标签

Cards List
#serving-optimization

@vllm_project: @Alibaba_Qwen 的 Qwen3-Omni 能听、能推理、能回复。实时服务它是个管道问题,不是单一模型的问题……

X AI KOLs Timeline · 2026-07-03 缓存

vLLM-Omni 引入分阶段流水线来实时服务阿里巴巴的 Qwen3-Omni,分别优化 Thinker、Talker 和 Code2Wav 三个阶段,在相同 GPU 上实现亚秒级首音频延迟和 5.4 倍吞吐量。

0 人收藏 0 人点赞
#serving-optimization

为扩散语言模型启用共享前缀的KV缓存

arXiv cs.LG · 2026-06-09 缓存

本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈