caching

标签

Cards List
#caching

面向无状态LLM API的对话数据系统架构设计:Hydration Proxy 模式

arXiv cs.AI · 昨天 缓存

本文提出 Hydration Proxy 模式——一种用于管理无状态LLM API对话状态的三层架构,旨在确保数据主权、优化缓存机制并提升企业系统中的语义锚定能力。

0 人收藏 0 人点赞
#caching

你如何确认长共享前缀确实被缓存了?

Reddit r/AI_Agents · 昨天

作者描述了提示中易变的请求标识符如何干扰前缀缓存,导致高流量用户的成本和延迟增加,并询问缓存改进的验证方法。

0 人收藏 0 人点赞
#caching

你改了一个东西,为什么整个AI管道又要重新构建了?

Reddit r/ArtificialInteligence · 2天前

aimake 是一个针对AI/ML管道的增量构建系统,使用基于内容的指纹技术来仅重建更改的步骤,优化昂贵的管道重新运行。

0 人收藏 0 人点赞
#caching

28天使用GPT-5.6 Sol在Extra High模式下未达限制:一次受控执行的结果

Reddit r/AI_Agents · 4天前

作者报告了运行一个AI代理28天未达限制的结果,处理了数百万个令牌,缓存率高,并保持可验证的目标。讨论了上下文工程的挑战,并请求类似执行的比较。

0 人收藏 0 人点赞
#caching

@_avichawla: 为什么 KV 缓存只存储 K 和 V 向量而不存储 Q?(一个流行的 LLM 技术面试问题)大语言模型是自回归的……

X AI KOLs Timeline · 5天前 缓存

本文解释了在自回归大语言模型中,为什么 KV 缓存只存储键和值向量而不存储查询向量,并详细介绍了优化令牌生成的推理过程。

0 人收藏 0 人点赞
#caching

优化1.1.1.1 DNS缓存以节省100TB内存

Hacker News Top · 2026-08-27 缓存

Cloudflare优化了其1.1.1.1 DNS缓存,将内存使用量减少超过50%,节省了100TB内存,并通过优化的Rust数据结构提升了性能。

0 人收藏 0 人点赞
#caching

@mattshumer_: 每次有VC发给我一家自动路由公司进行尽职调查时,我都会回复类似这样的内容。如果缓存不是个事儿……

X AI KOLs Timeline · 2026-08-25 缓存

这篇帖子批评了AI中的自动路由公司,强调频繁切换模型会使提示缓存失效,导致更高的token成本和效率低下。

0 人收藏 0 人点赞
#caching

@TheAhmadOsman: 澄清一下,OMP 有 97.5% 的缓存命中率。我的大部分使用都是自托管模型,并非所有推理设置都正确报告了遥测数据,所以…

X AI KOLs Timeline · 2026-08-23 缓存

一位用户澄清 OMP 有 97.5% 的缓存命中率,并讨论了自托管 DeepSeek V4 Flash 模型的使用,解决了对推理设置中缓存性能的担忧。

0 人收藏 0 人点赞
#caching

@rohanpaul_ai: 智能体的token消耗速率接近人类的5倍,同时其使用量自二月以来已暴涨约14倍。一旦智能体…

X AI KOLs Timeline · 2026-08-23 缓存

AI智能体消耗token的速率接近人类的5倍,使用量自二月以来已暴涨14倍,这可能会降低像OpenRouter这样的路由器利用模型提供商之间竞争的能力,原因在于缓存和任务连续性。

0 人收藏 0 人点赞
#caching

撤销访问权限后,智能体还能工作多久?无人测量

Reddit r/AI_Agents · 2026-08-21

文章讨论了在撤销AI智能体访问权限时被忽视的时间差,强调了缓存凭证和副作用如何导致撤销后的意外行为,并提议将测量这种延迟作为关键指标。

0 人收藏 0 人点赞
#caching

如何在重新启动 llama.cpp 后处理长上下文会话?

Reddit r/LocalLLaMA · 2026-08-20

用户提出在 llama.cpp 中为长上下文会话实现自动缓存机制,以避免重启后的重复预填充,提升在较慢硬件上的可用性。

0 人收藏 0 人点赞
#caching

可通过设计实现缓存?针对边缘内存带宽墙的Mixture-of-Experts路由器局部性训练:一项预注册的负面结果与系统测量研究

arXiv cs.AI · 2026-08-20 缓存

本文提出了一项关于训练Mixture-of-Experts路由器以实现缓存局部性对抗内存带宽墙的预注册负面结果,表明尽管采用了训练机制,未命中率降低与语言建模质量之间存在权衡。

0 人收藏 0 人点赞
#caching

LLM服务的一年:负载演化、缓存与负载均衡

arXiv cs.AI · 2026-08-17 缓存

本文分析了来自Chutes的一年生产追踪数据,以研究LLM服务负载,揭示时间演化和用户-模型交互,以改进服务系统基准测试。

0 人收藏 0 人点赞
#caching

QV-PIC:面向高效RAG服务的查询感知视觉位置无关缓存

arXiv cs.CL · 2026-08-13 缓存

本文介绍了QV-PIC,一种查询感知的双分辨率位置无关缓存框架,用于高效的RAG服务,相比朴素渲染图像PIC,F1值提升21.6个点,同时相对于完整预填充将首令牌时间降低83.8%。

0 人收藏 0 人点赞
#caching

KGCache:面向大语言模型知识图谱推理的摊销式子图检索

arXiv cs.AI · 2026-08-11 缓存

KGCache是一种用于一跳知识图谱邻域的内存缓存,可减少使用大语言模型的KGQA系统中冗余的子图检索。在WebQSP和CWQ上的评估显示,它可将知识图谱检索速度提升最多1.91倍,并表明语义缓存能进一步提高命中率。

0 人收藏 0 人点赞
#caching

Fast Haskell Scripts on GitHub Actions

Lobsters Hottest · 2026-08-10 缓存

The article explains how to speed up running Haskell scripts with Magix on GitHub Actions by caching dependencies and compiled artifacts, reducing full build times from over 100 seconds to near-instant reruns.

0 人收藏 0 人点赞
#caching

Nix Evaluation Is a Scheduling Problem

Lobsters Hottest · 2026-08-07 缓存

The article argues that Nix evaluation is fundamentally a scheduling problem and introduces Evix, a library-first async Nix evaluation engine designed for persistent, structured evaluation results.

0 人收藏 0 人点赞
#caching

web服务器部署模型在爱好者规模下失效

Lobsters Hottest · 2026-08-06 缓存

一篇技术文章,探讨传统web服务器部署模型(TLS终止、反向代理、静态文件服务、缓存)如何在对必须易于自托管的爱好者级应用上失效,导致效率低下和复杂度增加。

0 人收藏 0 人点赞
#caching

一个 llama.cpp PR 在 GPU 上缓存“热”MoE 专家 — 8GB VRAM 下报告 33 → 56 tok/s

Reddit r/LocalLLaMA · 2026-08-04

一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。

0 人收藏 0 人点赞
#caching

LLM 路由不是要解决的问题;token 效率才是

Reddit r/AI_Agents · 2026-08-02

本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈