@charles_irl: 当查询规划器与推理引擎相遇,你会得到什么?每分钟超过十亿个token!隆重介绍Qu…
摘要
Quail 是一个开源 AI-SQL 引擎,它将查询规划与 LLM 推理相结合,在 H100 GPU 上实现了每分钟超过十亿个输入 token 的处理能力。
查看缓存全文
缓存时间: 2026/09/25 02:34
当你将查询规划器与推理引擎结合会怎样?
每分钟处理超过十亿令牌!
隆重介绍Quail——一个用于运行AI-SQL查询的开源系统。
Shreya Shankar (@sh_reya): 很高兴与大家分享Quail,这是我们的全新开源AI-SQL引擎(与Modal的合作成果)!通过协同规划查询与LLM推理,单张H100显卡仅处理单个查询就能实现每分钟处理超过10亿输入令牌的速度😱🚀
AI驱动的数据算子开创了全新而有趣的推理工作负载👇
相似文章
@HotAisle: 太棒了。我想知道他们用的是谁的 MI300x... ;-)
Kog 宣布在标准数据中心 GPU 上实现每请求每秒 3000+ 输出令牌的实时大语言模型推理,将此前仅限于定制芯片的高速推理引入生产硬件。
@zhyncs42: Qwen推理团队非常棒——他们在TokenSpeed上针对智能体工作负载实现了540 TPS,期待他们...
Qwen推理团队宣布了TokenSpeed,这是一个针对智能体工作负载的高性能LLM推理引擎,实现了540 TPS,并提供开源预览版。
QLLM:无需Transformer和Mamba,具有O(1)推理的新型架构终于以模型形式发布
QLLM 引入了一种无需Transformer或Mamba的新型架构,实现了O(1)推理且无KV缓存。已发布一个1亿参数的模型作为概念验证,代码开源。
标准GPU上的实时LLM推理:每请求3k tokens/秒
Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。
@bastani_behnam:我们刚刚发布了如何在 27B 模型上解锁 +50% 推理容量——无需新 GPU、无需新节点,成本仅为一小部分……
OpenInfer 展示“垂直拆解”,通过单节点 AMD EPYC CPU 与 Nvidia L40S GPU 协同执行量化层,并配合自定义 SLA 感知调度器,将 Qwen 3.5 27B 的吞吐量提升约 50%。