标签
vLLM-Omni 引入分阶段流水线来实时服务阿里巴巴的 Qwen3-Omni,分别优化 Thinker、Talker 和 Code2Wav 三个阶段,在相同 GPU 上实现亚秒级首音频延迟和 5.4 倍吞吐量。
本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。