标签
这篇文章讨论了语音代理中内存检索的关键挑战,强调了测量每轮 P99 延迟、使用预取以及预算内存令牌以减少延迟并改善用户体验的必要性。
本文介绍了用于人工智能系统的内核管理共享内存,通过集中化内存管理来提高多智能体环境中的个性化与效率,评估显示其相比其他方法有显著提升。
Arize Phoenix 推出了M3,它增加了稀疏注意力和1M令牌上下文窗口,通过将长工具历史保留在上下文中来减少AI智能体的延迟和成本。
KeenableAI 被宣布为一款专门为AI代理设计的AI原生搜索引擎,拥有自己的爬虫、网页索引和基础设施,以改善延迟、质量和成本效率。
Pipecat团队发布了PhoneLLM Alpha 1,这是一个为低延迟语音代理应用优化的开源AI模型,其性能与更大模型相当,成本却只有一小部分。他们还推出了PhoneBench v1,一个用于评估电话代理场景中大语言模型的基准测试。
语音代理常面临延迟问题,主要并非源于模型,而是端点检测等组件;优化VAD和采用合适的基准测试可有效降低轮次延迟。
Agnost AI推出其首款模型agnost-*******-0.1,基于客户生产痕迹训练,以超越前沿模型,在任务成功率、延迟和成本方面带来重大改进,提供定制微调服务。
SAGE是一种面向生产级RAG系统的基于学习的SLO感知自适应检索策略,能够根据每个查询动态选择检索段落数量,在几乎不损失质量的前提下提升SLO合规性并降低延迟与成本。
加州大学圣巴巴拉分校和 LinkedIn 的新研究提出了一种自推测代理,将代理和推测者角色统一到一个模型中,通过联合代理-推测者强化学习提高了下一个工具调用预测准确率(Hit@1),同时保持了任务成功率。
UltraViT 是一个面向大型视觉语言模型的延迟优化视觉编码器,专为端侧部署设计,采用金字塔架构和两阶段生成式预训练策略,以1.7倍速度实现最先进的性能。
FlashTrie提出了一种GPU加速的约束束搜索方法用于生成式检索,利用简洁的trie布局和协作式CUDA内核来降低解码延迟,实现大规模实时服务,在商业搜索引擎中实现了高达24倍的加速和0.71%的收入提升。
一位资深AI工程师分享了2026年需要掌握的关键技能,包括:系统性输出阅读、上下文工程、工具描述规范、评估设计、模型路由、提示版本管理、置信度评分、流式响应架构、回退链、延迟预算、故障分类、代理与工作流决策,以及将故障复盘作为作品集内容。
研究人员受Gemma 4 12B启发,仅花费100美元训练了一个无需视觉编码器的视觉语言模型,在M3 Pro MacBook上实现了端到端延迟降低30%。
InfraMind 引入了一个基础设施感知的多智能体大语言模型编排框架,利用强化学习根据实时系统负载动态选择模型和拓扑结构,在高负载下实现了高达 7 倍的延迟降低和 99.9% 的 SLO 达标率。
ObjectCache提出使用S3兼容的对象存储来实现LLM KV缓存的重用,以降低成本并增加容量,同时通过协同设计的存储协议和传输调度将延迟开销降至最低。实验表明,对于64K上下文,相比本地DRAM仅增加5.6%的延迟。
本文介绍了针对代理型计划-执行流水线的时序语义缓存与MCP工作流优化,在缓存命中时实现了高达30.6倍的加速,并在AssetOpsBench工业基准测试上实现了1.67倍的整体加速。
一篇博客文章,详细介绍了如何检测 Snapdragon 在 CI 中的静默 NPU 回退,包括在真实硬件上运行、基于变异系数的门控以及解析 ORT 性能分析 JSON 以识别回退操作等方法。
本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。