标签
本文提出 Hydration Proxy 模式——一种用于管理无状态LLM API对话状态的三层架构,旨在确保数据主权、优化缓存机制并提升企业系统中的语义锚定能力。
aimake 是一个针对AI/ML管道的增量构建系统,使用基于内容的指纹技术来仅重建更改的步骤,优化昂贵的管道重新运行。
作者报告了运行一个AI代理28天未达限制的结果,处理了数百万个令牌,缓存率高,并保持可验证的目标。讨论了上下文工程的挑战,并请求类似执行的比较。
本文解释了在自回归大语言模型中,为什么 KV 缓存只存储键和值向量而不存储查询向量,并详细介绍了优化令牌生成的推理过程。
Cloudflare优化了其1.1.1.1 DNS缓存,将内存使用量减少超过50%,节省了100TB内存,并通过优化的Rust数据结构提升了性能。
这篇帖子批评了AI中的自动路由公司,强调频繁切换模型会使提示缓存失效,导致更高的token成本和效率低下。
一位用户澄清 OMP 有 97.5% 的缓存命中率,并讨论了自托管 DeepSeek V4 Flash 模型的使用,解决了对推理设置中缓存性能的担忧。
AI智能体消耗token的速率接近人类的5倍,使用量自二月以来已暴涨14倍,这可能会降低像OpenRouter这样的路由器利用模型提供商之间竞争的能力,原因在于缓存和任务连续性。
文章讨论了在撤销AI智能体访问权限时被忽视的时间差,强调了缓存凭证和副作用如何导致撤销后的意外行为,并提议将测量这种延迟作为关键指标。
用户提出在 llama.cpp 中为长上下文会话实现自动缓存机制,以避免重启后的重复预填充,提升在较慢硬件上的可用性。
本文提出了一项关于训练Mixture-of-Experts路由器以实现缓存局部性对抗内存带宽墙的预注册负面结果,表明尽管采用了训练机制,未命中率降低与语言建模质量之间存在权衡。
本文分析了来自Chutes的一年生产追踪数据,以研究LLM服务负载,揭示时间演化和用户-模型交互,以改进服务系统基准测试。
本文介绍了QV-PIC,一种查询感知的双分辨率位置无关缓存框架,用于高效的RAG服务,相比朴素渲染图像PIC,F1值提升21.6个点,同时相对于完整预填充将首令牌时间降低83.8%。
KGCache是一种用于一跳知识图谱邻域的内存缓存,可减少使用大语言模型的KGQA系统中冗余的子图检索。在WebQSP和CWQ上的评估显示,它可将知识图谱检索速度提升最多1.91倍,并表明语义缓存能进一步提高命中率。
The article explains how to speed up running Haskell scripts with Magix on GitHub Actions by caching dependencies and compiled artifacts, reducing full build times from over 100 seconds to near-instant reruns.
The article argues that Nix evaluation is fundamentally a scheduling problem and introduces Evix, a library-first async Nix evaluation engine designed for persistent, structured evaluation results.
一篇技术文章,探讨传统web服务器部署模型(TLS终止、反向代理、静态文件服务、缓存)如何在对必须易于自托管的爱好者级应用上失效,导致效率低下和复杂度增加。
一个 llama.cpp PR 增加了基于热力图的“热”MoE 专家 GPU 缓存,在 8GB VRAM 下对某些模型将 tok/s 提升了约 1.7-2 倍,但对其他模型结果不一。
本文认为,模型路由并不是真正要解决的问题——token 效率才是。文章倡导一种整体闭环方法,将更便宜的默认模型、偏好感知路由和更好的缓存(例如 Coinbase 将缓存命中率从 5% 提升到 60%)结合起来,以最大化每美元获得的有用智能。