标签
本文介绍了推测性宏提交(SMC),这是一个两层智能体系统,通过推测性地执行未来动作链并在匹配时提交它们来减少工具使用LLM智能体的延迟,从而实现比顺序执行更快的速度。
本文提出推测性编程工具调用(sPTC),一种优化AI框架中工具调用的技术。它受CPU和大语言模型中推测执行的启发,通过重叠执行与令牌生成来降低延迟。
介绍 Speculative Programmatic Tool Calling (sPTC),一种在代码生成期间推测工具调用的技术,以与令牌生成和执行时间重叠,提高 AI 框架中的效率。
Uber 开源了 SubmitQueue,这是一个高性能推测性合并队列,可针对预测的 HEAD 未来状态并行验证多个更改,从而在大规模环境下保持主干(trunk)绿色。
本文介绍了一种用于处理突发性LLM推理工作负载的预测性投机KV复制方法,代码可在GitHub上获取。
本文介绍了面向LLM代理的记忆增强型推测执行技术,利用三种在线记忆系统在行动预测上提升19-39%的准确率,在观察预测上提升最高2.5倍,同时保持无损且零额外挂钟时间成本。
GPUHedge是一个开源工具,它使用投机执行在无服务器GPU提供商之间进行对冲,将冷启动p95延迟从117秒降低到30秒。
SpecHop 是一个连续推测框架,通过维护多个推测线程并异步验证预测,加速多跳检索代理,在保持最终模型输出不变的情况下,延迟降低高达40%。
Accio 是一种推测执行框架,通过利用离线站点结构分析和在线快速路径选择,降低网络代理的成本和延迟,实现每任务成本降低1.9倍,延迟降低33.4%,同时保持准确性。