标签
Relativity Networks 已筹集 2200 万美元用于开发空心光纤技术,该技术可将延迟降低 30%,并可能改变为人工智能计算而优化的数据中心布局。
一项比较MCP和文件系统访问在20个生产场景中针对AI代理的基准研究发现,文件系统访问将LLM成本降低了27%,延迟降低了32%,同时提高了答案质量。
本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。
阿里云推出一站式 AI 内存解决方案,结合 PolarDB、MemOS 和 MemTensor,在单个 PolarDB-PG 实例中提供关系型、向量和图形检索,将 P99 延迟降低高达 89.2%。
本文提出了一种面向多智能体系统的工作负载感知缓存逐出策略,该策略利用重新计算成本、DAG依赖计数和智能体调用频率来保留有价值的缓存条目,相比于无缓存基线最多可将延迟降低64.7%,相比于次优的有限容量方法平均可降低31.1%。
FlashRT是一个智能体框架,指导编码智能体自动优化和部署实时多模态应用,在NVIDIA B200 GPU上实现高达70倍的延迟降低,在AMD MI355X上实现3.6倍的吞吐量提升。
本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。
本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。
Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。
ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。
Accio 是一种推测执行框架,通过利用离线站点结构分析和在线快速路径选择,降低网络代理的成本和延迟,实现每任务成本降低1.9倍,延迟降低33.4%,同时保持准确性。
LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。
LatentRAG 是一个新颖的框架,将智能体 RAG 的推理与检索过程转移至连续的潜在空间,在保持与显式方法相当的性能的同时,将推理延迟降低了约 90%。
OpenAI详细说明了WebSocket和API优化如何将代理工作流的延迟减少了40%,使得GPT-5.3-Codex-Spark达到接近每秒1000个token。
OpenAI 推出提示词缓存功能,这是一项自动特性,通过在 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 模型上重用最近缓存的输入令牌,可将 API 成本降低 50% 并改善延迟。该功能会自动应用于超过 1,024 个令牌的提示词,无需开发者进行集成更改。