@charles_irl: 当查询规划器与推理引擎相遇,你会得到什么?每分钟超过十亿个token!隆重介绍Qu…

X AI KOLs Timeline 工具

摘要

Quail 是一个开源 AI-SQL 引擎,它将查询规划与 LLM 推理相结合,在 H100 GPU 上实现了每分钟超过十亿个输入 token 的处理能力。

当查询规划器与推理引擎相遇,你会得到什么? 每分钟超过十亿个 token! 隆重介绍 Quail,一个用于运行 AI-SQL 查询的开源系统。
查看原文
查看缓存全文

缓存时间: 2026/09/25 02:34

当你将查询规划器与推理引擎结合会怎样?

每分钟处理超过十亿令牌!

隆重介绍Quail——一个用于运行AI-SQL查询的开源系统。

Shreya Shankar (@sh_reya): 很高兴与大家分享Quail,这是我们的全新开源AI-SQL引擎(与Modal的合作成果)!通过协同规划查询与LLM推理,单张H100显卡仅处理单个查询就能实现每分钟处理超过10亿输入令牌的速度😱🚀

AI驱动的数据算子开创了全新而有趣的推理工作负载👇

相似文章

标准GPU上的实时LLM推理:每请求3k tokens/秒

Hacker News Top

Kog AI 发布了 Kog Inference Engine 的技术预览版,通过协同设计模型架构、运行时和底层 GPU 代码,在标准数据中心 GPU 上实现了每请求 3,000 tokens/s 的性能,面向延迟敏感的 AI 代理工作流。