标签
一条推文列出了16种推理优化技术,用于实现低于一秒的LLM响应,包括KV缓存、推测解码、FlashAttention和各种并行化方法。
文章质疑了许多 Web 应用中对 Service Worker 的必要性,认为简单的 HTTP 缓存通常就足够了,而 Service Worker 会带来复杂性和缓存过期的风险。
本文在不同工作负载下对六种Go内存缓存设计进行了基准测试,发现使用256个锁的分片映射在单互斥锁和读写锁方法中表现最佳,尤其是在多核系统上。
据报道,Coinbase 通过智能路由到更便宜的模型(如 GLM 5.2 和 Kimi 2.7)以及实现缓存,将 AI 代币花费减少了一半,凸显了 AI 成本优化的趋势。
LMCache是一个开源库,它使KV缓存持久化并可在请求之间共享,消除了RAG和多轮对话工作负载中的重复计算,实现了高达15倍的吞吐量提升和3-10倍的首令牌时间减少。
讨论MoE模型的多层级缓存策略,通过将频繁激活的专家保留在GPU上来提升推理速度,参考了PowerInfer和llama.cpp分支等现有实现。
这篇客座文章探讨了提议的跨源存储API,用于改进Transformers.js中AI模型资源的缓存,从而实现跨源的高效复用,同时保持浏览器内推理的隐私和完整性。
关于在使用 GLM 5.2 模型时避免速率限制和降低成本的指南,涵盖提示批处理、缓存、免费模型替代方案、努力水平、上下文窗口管理和自托管。
Venkat 解释道,热路径中未经优化的CPU工作会严重影响推理性能,并介绍了他在 mooncake 中提交的PR,该PR添加了一个内存池,用于实现无锁、无分配的操作,使 vLLM 和 SGL 项目受益。
为DeepSeek V4 Pro优化的Codex技能,通过冻结skill文件和极简输出可节省60-80% token,并提供跨对话持久记忆功能。
RFC 10008 定义了新的 HTTP QUERY 方法,允许包含请求体的安全、幂等且可缓存的请求,解决了 GET 和 POST 在 RPC 风格 API 中的局限性。
本推文介绍了Cloudflare提供的多种开发功能,包括对象存储R2、后端API Worker、AI网关AI Gateway、容器、缓存KV、数据库D1和PostgreSQL连接HyperDrive等,强调其价格便宜、功能丰富且免费额度充足。
CacheRL训练用于多步工具调用任务的小型智能体基础模型,通过缓存回滚和混合奖励塑造,以100倍更少的计算量实现了92%的过程准确率(接近GPT-5的94%),并在知识迁移、缓存感知奖励以及迭代SFT/GRPO训练方面进行了创新。
关于在 Microsoft Agent Framework 中通过使用网关进行缓存、上下文压缩和模型路由来优化成本的实用指南,确保每个步骤仅使用必要的智能。
本文介绍了通过构建智能缓存网关(Hawiyat Composer)如何利用精确匹配缓存、语义缓存、模型路由和本地路由消除重复的token浪费,从而节省大量AI API成本。
讨论了AI代理工作流中由于重复上下文导致的token浪费问题,介绍了一个名为Badgr-auto的开源代理用于去重,并询问社区如何应对该问题。
MinLiBuilds 发布了一个真正的 fork 功能,允许在终端中基于对话历史通过 Command+F 创建全新的子窗口,支持多层 fork,并声称比 Claude Code 更丝滑、享受 100% 缓存且免费。
一个程序员利用全网390万个开放DNS解析器的缓存来存储文件碎片,创建了一个名为dnsfs的荒诞开源项目,文件随着缓存过期而消失。
Anyscale展示了通过使用Alluxio NVMe缓存和Ray Data,跨区域训练数据读取速度提升了20倍,显示1TB数据的缓存预热读取时间从4,241秒降至208秒。