latency-optimization

标签

Cards List
#latency-optimization

P50 内存检索的 15 毫秒对语音代理毫无作用

Reddit r/AI_Agents · 4天前

这篇文章讨论了语音代理中内存检索的关键挑战,强调了测量每轮 P99 延迟、使用预取以及预算内存令牌以减少延迟并改善用户体验的必要性。

0 人收藏 0 人点赞
#latency-optimization

全系统个性化的内核管理共享内存

arXiv cs.AI · 2026-09-11 缓存

本文介绍了用于人工智能系统的内核管理共享内存,通过集中化内存管理来提高多智能体环境中的个性化与效率,评估显示其相比其他方法有显著提升。

0 人收藏 0 人点赞
#latency-optimization

@ArizePhoenix: 对于智能体,活跃参数是你在延迟和成本上支付的东西,而智能体循环会重新发送上下文,重试工具调用……

X AI KOLs Following · 2026-09-03

Arize Phoenix 推出了M3,它增加了稀疏注意力和1M令牌上下文窗口,通过将长工具历史保留在上下文中来减少AI智能体的延迟和成本。

0 人收藏 0 人点赞
#latency-optimization

@svpino: 这些人正在为代理构建一个新的搜索引擎:• 他们有自己的爬虫 • 他们有自己的网页索引 •…

X AI KOLs Timeline · 2026-08-25 缓存

KeenableAI 被宣布为一款专门为AI代理设计的AI原生搜索引擎,拥有自己的爬虫、网页索引和基础设施,以改善延迟、质量和成本效率。

0 人收藏 0 人点赞
#latency-optimization

pipecat-ai/phonellm-alpha-1

Hugging Face Models Trending · 2026-08-24 缓存

Pipecat团队发布了PhoneLLM Alpha 1,这是一个为低延迟语音代理应用优化的开源AI模型,其性能与更大模型相当,成本却只有一小部分。他们还推出了PhoneBench v1,一个用于评估电话代理场景中大语言模型的基准测试。

0 人收藏 0 人点赞
#latency-optimization

语音代理的最大延迟未必来自模型

Reddit r/ArtificialInteligence · 2026-08-22

语音代理常面临延迟问题,主要并非源于模型,而是端点检测等组件;优化VAD和采用合适的基准测试可有效降低轮次延迟。

0 人收藏 0 人点赞
#latency-optimization

@ShubhamInTech: 不要再只用你的代理日志来调试。用它们来训练你自己的模型。今天我们推出Agnost AI (YC S26)的第一款模型…

X AI KOLs Following · 2026-08-20 缓存

Agnost AI推出其首款模型agnost-*******-0.1,基于客户生产痕迹训练,以超越前沿模型,在任务成功率、延迟和成本方面带来重大改进,提供定制微调服务。

0 人收藏 0 人点赞
#latency-optimization

SAGE:面向生产级RAG系统的SLO感知自适应检索策略

arXiv cs.LG · 2026-08-11 缓存

SAGE是一种面向生产级RAG系统的基于学习的SLO感知自适应检索策略,能够根据每个查询动态选择检索段落数量,在几乎不损失质量的前提下提升SLO合规性并降低延迟与成本。

0 人收藏 0 人点赞
#latency-optimization

@dair_ai: // 代理是其自身最佳的推测者 // 代理花费大量实际时间等待工具结果。推测…

X AI KOLs Following · 2026-07-30 缓存

加州大学圣巴巴拉分校和 LinkedIn 的新研究提出了一种自推测代理,将代理和推测者角色统一到一个模型中,通过联合代理-推测者强化学习提高了下一个工具调用预测准确率(Hit@1),同时保持了任务成功率。

0 人收藏 0 人点赞
#latency-optimization

UltraViT:面向大型视觉语言模型的延迟优化端侧视觉编码器

Hugging Face Daily Papers · 2026-07-25 缓存

UltraViT 是一个面向大型视觉语言模型的延迟优化视觉编码器,专为端侧部署设计,采用金字塔架构和两阶段生成式预训练策略,以1.7倍速度实现最先进的性能。

0 人收藏 0 人点赞
#latency-optimization

FlashTrie:一种用于生成式检索的GPU加速约束束搜索方法

arXiv cs.LG · 2026-07-14 缓存

FlashTrie提出了一种GPU加速的约束束搜索方法用于生成式检索,利用简洁的trie布局和协作式CUDA内核来降低解码延迟,实现大规模实时服务,在商业搜索引擎中实现了高达24倍的加速和0.71%的收入提升。

0 人收藏 0 人点赞
#latency-optimization

@DeRonin_: 作为2026年的人工智能工程师,请学习这一点:> 系统性输出阅读。在1000个模型响应中进行模式识别是……

X AI KOLs Timeline · 2026-06-25 缓存

一位资深AI工程师分享了2026年需要掌握的关键技能,包括:系统性输出阅读、上下文工程、工具描述规范、评估设计、模型路由、提示版本管理、置信度评分、流式响应架构、回退链、延迟预算、故障分类、代理与工作流决策,以及将故障复盘作为作品集内容。

0 人收藏 0 人点赞
#latency-optimization

@andimarafioti:没有视觉编码器,VLM也能‘看见’吗?我们受Gemma 4 12B启发,花100美元训练了一个。在M3 Pro MacBook上的延迟:…

X AI KOLs Timeline · 2026-06-18 缓存

研究人员受Gemma 4 12B启发,仅花费100美元训练了一个无需视觉编码器的视觉语言模型,在M3 Pro MacBook上实现了端到端延迟降低30%。

0 人收藏 0 人点赞
#latency-optimization

INFRAMIND:基础设施感知的多智能体编排

arXiv cs.AI · 2026-06-11 缓存

InfraMind 引入了一个基础设施感知的多智能体大语言模型编排框架,利用强化学习根据实时系统负载动态选择模型和拓扑结构,在高负载下实现了高达 7 倍的延迟降低和 99.9% 的 SLO 达标率。

0 人收藏 0 人点赞
#latency-optimization

ObjectCache: 用于KV缓存重用的分层对象存储检索

arXiv cs.AI · 2026-05-25 缓存

ObjectCache提出使用S3兼容的对象存储来实现LLM KV缓存的重用,以降低成本并增加容量,同时通过协同设计的存储协议和传输调度将延迟开销降至最低。实验表明,对于64K上下文,相比本地DRAM仅增加5.6%的延迟。

0 人收藏 0 人点赞
#latency-optimization

评估代理型计划-执行流水线中的时序语义缓存与工作流优化

Hugging Face Daily Papers · 2026-05-20 缓存

本文介绍了针对代理型计划-执行流水线的时序语义缓存与MCP工作流优化,在缓存命中时实现了高达30.6倍的加速,并在AssetOpsBench工业基准测试上实现了1.67倍的整体加速。

0 人收藏 0 人点赞
#latency-optimization

我们如何在 CI 中捕获 Snapdragon 上的静默 NPU 回退 [D]

Reddit r/MachineLearning · 2026-05-15

一篇博客文章,详细介绍了如何检测 Snapdragon 在 CI 中的静默 NPU 回退,包括在真实硬件上运行、基于变异系数的门控以及解析 ORT 性能分析 JSON 以识别回退操作等方法。

0 人收藏 0 人点赞
#latency-optimization

从早期经验中学习智能体路由

arXiv cs.CL · 2026-05-11 缓存

本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈