标签
vLLM-Omni 引入分阶段流水线来实时服务阿里巴巴的 Qwen3-Omni,分别优化 Thinker、Talker 和 Code2Wav 三个阶段,在相同 GPU 上实现亚秒级首音频延迟和 5.4 倍吞吐量。