speculative-execution

标签

Cards List
#speculative-execution

提升工具使用智能体速度的推测性宏提交

arXiv cs.AI · 2026-09-04 缓存

本文介绍了推测性宏提交(SMC),这是一个两层智能体系统,通过推测性地执行未来动作链并在匹配时提交它们来减少工具使用LLM智能体的延迟,从而实现比顺序执行更快的速度。

0 人收藏 0 人点赞
#speculative-execution

推测性编程工具调用(12分钟阅读)

TLDR AI · 2026-08-25 缓存

本文提出推测性编程工具调用(sPTC),一种优化AI框架中工具调用的技术。它受CPU和大语言模型中推测执行的启发,通过重叠执行与令牌生成来降低延迟。

0 人收藏 0 人点赞
#speculative-execution

@a1zhang: 介绍 Speculative Programmatic Tool Calling (sPTC)!一种用于推测工具调用的一般技术类。

X AI KOLs Timeline · 2026-08-24 缓存

介绍 Speculative Programmatic Tool Calling (sPTC),一种在代码生成期间推测工具调用的技术,以与令牌生成和执行时间重叠,提高 AI 框架中的效率。

0 人收藏 0 人点赞
#speculative-execution

Uber SubmitQueue:高性能推测性合并队列

Hacker News Top · 2026-08-01 缓存

Uber 开源了 SubmitQueue,这是一个高性能推测性合并队列,可针对预测的 HEAD 未来状态并行验证多个更改,从而在大规模环境下保持主干(trunk)绿色。

0 人收藏 0 人点赞
#speculative-execution

面向突发性LLM推理的预测性投机KV复制

Hacker News Top · 2026-07-31

本文介绍了一种用于处理突发性LLM推理工作负载的预测性投机KV复制方法,代码可在GitHub上获取。

0 人收藏 0 人点赞
#speculative-execution

基于记忆的推测:LLM代理的无损加速

arXiv cs.LG · 2026-07-15 缓存

本文介绍了面向LLM代理的记忆增强型推测执行技术,利用三种在线记忆系统在行动预测上提升19-39%的准确率,在观察预测上提升最高2.5倍,同时保持无损且零额外挂钟时间成本。

0 人收藏 0 人点赞
#speculative-execution

GPUHedge:在无服务器GPU提供商之间进行对冲可将冷启动p95延迟从117秒降低到30秒 [P]

Reddit r/MachineLearning · 2026-07-13

GPUHedge是一个开源工具,它使用投机执行在无服务器GPU提供商之间进行对冲,将冷启动p95延迟从117秒降低到30秒。

0 人收藏 0 人点赞
#speculative-execution

SpecHop: 连续推测加速多跳检索代理

arXiv cs.CL · 2026-05-22 缓存

SpecHop 是一个连续推测框架,通过维护多个推测线程并异步验证预测,加速多跳检索代理,在保持最终模型输出不变的情况下,延迟降低高达40%。

0 人收藏 0 人点赞
#speculative-execution

Skim:用于快速高效网络代理的推测执行框架

arXiv cs.AI · 2026-05-19 缓存

Accio 是一种推测执行框架,通过利用离线站点结构分析和在线快速路径选择,降低网络代理的成本和延迟,实现每任务成本降低1.9倍,延迟降低33.4%,同时保持准确性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈