@cyrusasg:推理服务是自动化研究最干净的目标之一。目前很多注意力集中在内核生成,但……
摘要
这条推文将推理服务确定为自动化研究的主要目标,强调在延迟、质量和吞吐量约束下的端到端优化,在统一搜索空间中涵盖各个方面,并暗示了未来的发展。
推理服务是自动化研究最干净的目标之一。目前很多注意力集中在内核生成,但更大的表面是端到端。
这是一个带有可验证目标的约束优化。保持延迟和质量SLA,最大化吞吐量。并行策略、批处理策略、缓存配置、投机者选择、路由、内核,所有这些都在一个搜索空间中。
这种优化也高度依赖于工作负载。
我们正在酝酿中,很快会有更多消息。
查看缓存全文
缓存时间: 2026/09/16 18:17
推理服务是自动化研究最清晰的目标之一。当前许多关注点集中在内核生成,但更广阔的战场在于端到端优化。
这是一个带可验证目标的约束优化问题:维持延迟与质量服务等级协议,同时最大化吞吐量。并行策略、批处理策略、缓存配置、推测器选择、路由策略和内核优化都属于同一搜索空间。
这类优化高度依赖工作负载特性。
我们正在酝酿更多进展,即将揭晓。
相似文章
@sdianahu: 1/ 快速AI推理即将重现搜索引擎的历史教训:低延迟为何如此重要
Dian Hu 将搜索引擎中低延迟的重要性与快速AI推理即将面临的需求进行了类比。
@asmah2107: 给所有询问推理工程应该构建什么的人:> 推理服务器(C++/Rust)> 分页KV缓存(如vLL…
一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。
@charles_irl: 几年前,人工智能的未来看起来一片黯淡——专有模型、专有推理服务……
Modal 宣布推出 Auto Endpoints,这是一项可通过一键实现优化的开源 AI 推理的服务,旨在对抗专有模型和服务的趋势。
@lftherios:1/ @karpathy 的 autoresearch 是今年最具代表性的智能体范式之一。问题在于……
Andrej Karpathy 的 autoresearch 范式揭示:当下 AI 智能体各自为战做实验,重复劳动、浪费算力,还不断「重新发明」死路。
@seclink: 另一个开源样本... 通常,你得为此付费,但既然它是开源的,它绝对是那些在手中不那么有价值的东西之一,所以他们将其作为开源发布。
这篇文章宣布了Autoresearch Bench,一个用于编码代理自主解决研究问题的开源基准测试,指出模型在自主研究循环中存在显著差异。