latency-reduction

标签

Cards List
#latency-reduction

Relativity Networks 筹集 2200 万美元以将更快的光纤技术引入数据中心

TechCrunch AI · 4天前 缓存

Relativity Networks 已筹集 2200 万美元用于开发空心光纤技术,该技术可将延迟降低 30%,并可能改变为人工智能计算而优化的数据中心布局。

0 人收藏 0 人点赞
#latency-reduction

我们对20个生产代理场景进行了MCP与文件系统访问的基准测试。文件系统设置将LLM成本降低了27%,延迟降低了32%

Reddit r/AI_Agents · 5天前

一项比较MCP和文件系统访问在20个生产场景中针对AI代理的基准研究发现,文件系统访问将LLM成本降低了27%,延迟降低了32%,同时提高了答案质量。

0 人收藏 0 人点赞
#latency-reduction

基于肘部的MoE路由:一种免训练的推理时插件用于专家选择

arXiv cs.LG · 2026-08-06 缓存

本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。

0 人收藏 0 人点赞
#latency-reduction

@alibaba_cloud: 一个 PolarDB,一个 MemOS——为 AI 提供的持久、永不宕机的内存。PolarDB 和 MemTensor 推出一站式 AI 内存解决…

X AI KOLs Timeline · 2026-07-30 缓存

阿里云推出一站式 AI 内存解决方案,结合 PolarDB、MemOS 和 MemTensor,在单个 PolarDB-PG 实例中提供关系型、向量和图形检索,将 P99 延迟降低高达 89.2%。

0 人收藏 0 人点赞
#latency-reduction

面向多智能体系统的工作负载感知缓存

arXiv cs.AI · 2026-07-24 缓存

本文提出了一种面向多智能体系统的工作负载感知缓存逐出策略,该策略利用重新计算成本、DAG依赖计数和智能体调用频率来保留有价值的缓存条目,相比于无缓存基线最多可将延迟降低64.7%,相比于次优的有限容量方法平均可降低31.1%。

0 人收藏 0 人点赞
#latency-reduction

FlashRT:引导智能体部署实时多模态应用的智能体框架

Hugging Face Daily Papers · 2026-07-20 缓存

FlashRT是一个智能体框架,指导编码智能体自动优化和部署实时多模态应用,在NVIDIA B200 GPU上实现高达70倍的延迟降低,在AMD MI355X上实现3.6倍的吞吐量提升。

0 人收藏 0 人点赞
#latency-reduction

Director: 通过在线主动专家放置加速分布式MoE服务

arXiv cs.LG · 2026-07-13 缓存

本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。

0 人收藏 0 人点赞
#latency-reduction

@Alacritic_Super: 如果你在构建生产级 LLM 应用,学习 LLM 缓存。缓存可降低延迟、GPU 利用率和 AP…

X AI KOLs Timeline · 2026-07-12 缓存

本文强调了在生产系统中使用 LLM 缓存的重要性,以减少延迟、GPU 利用率和成本,并介绍了 LMCache,这是一个用于可扩展 LLM 推理的开源 KV 缓存管理层。

0 人收藏 0 人点赞
#latency-reduction

@PyTorch:在大型语言模型和推荐系统中,归一化层常因硬件分块要求独特而导致内存瓶颈…

X AI KOLs Following · 2026-07-10 缓存

Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。

0 人收藏 0 人点赞
#latency-reduction

ProactiveLLM: 学习主动交互的流式大语言模型

arXiv cs.CL · 2026-06-02 缓存

ProactiveLLM 提出了一种方法,使流式大语言模型能够基于内源性线索主动决定何时生成输出,通过基于掩码的流式建模和同步特权自蒸馏,在无需外部标注的情况下降低延迟。

0 人收藏 0 人点赞
#latency-reduction

Skim:用于快速高效网络代理的推测执行框架

arXiv cs.AI · 2026-05-19 缓存

Accio 是一种推测执行框架,通过利用离线站点结构分析和在线快速路径选择,降低网络代理的成本和延迟,实现每任务成本降低1.9倍,延迟降低33.4%,同时保持准确性。

0 人收藏 0 人点赞
#latency-reduction

LiteFrame: 高效视觉编码器解锁视频大语言模型的帧缩放

Hugging Face Daily Papers · 2026-05-17 缓存

LiteFrame提出了一种轻量级视频编码器,采用压缩令牌蒸馏(Compressed Token Distillation)训练,可降低延迟,并使视频大语言模型能够处理8倍以上的帧数以实现长视频理解,在降低计算量的同时提高准确性。

0 人收藏 0 人点赞
#latency-reduction

LatentRAG:用于高效智能体 RAG 的潜在推理与检索

arXiv cs.CL · 2026-05-08 缓存

LatentRAG 是一个新颖的框架,将智能体 RAG 的推理与检索过程转移至连续的潜在空间,在保持与显式方法相当的性能的同时,将推理延迟降低了约 90%。

0 人收藏 0 人点赞
#latency-reduction

在Responses API中使用WebSocket加速代理工作流

OpenAI Blog · 2026-04-22 缓存

OpenAI详细说明了WebSocket和API优化如何将代理工作流的延迟减少了40%,使得GPT-5.3-Codex-Spark达到接近每秒1000个token。

0 人收藏 0 人点赞
#latency-reduction

API 中的提示词缓存

OpenAI Blog · 2024-10-01 缓存

OpenAI 推出提示词缓存功能,这是一项自动特性,通过在 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 模型上重用最近缓存的输入令牌,可将 API 成本降低 50% 并改善延迟。该功能会自动应用于超过 1,024 个令牌的提示词,无需开发者进行集成更改。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈