caching

标签

Cards List
#caching

@divaagurlxw: 如果我想让LLM响应低于一秒,我会研究的推理优化方法:1.KV-Caching 2.Speculative Decoding 3.FlashAtte…

X AI KOLs Timeline · 2026-06-29 缓存

一条推文列出了16种推理优化技术,用于实现低于一秒的LLM响应,包括KV缓存、推测解码、FlashAttention和各种并行化方法。

0 人收藏 0 人点赞
#caching

你可能不需要 Service Worker

Lobsters Hottest · 2026-06-29 缓存

文章质疑了许多 Web 应用中对 Service Worker 的必要性,认为简单的 HTTP 缓存通常就足够了,而 Service Worker 会带来复杂性和缓存过期的风险。

0 人收藏 0 人点赞
#caching

分片你的锁:对6种Go缓存设计进行基准测试

Lobsters Hottest · 2026-06-27 缓存

本文在不同工作负载下对六种Go内存缓存设计进行了基准测试,发现使用256个锁的分片映射在单互斥锁和读写锁方法中表现最佳,尤其是在多核系统上。

0 人收藏 0 人点赞
#caching

@GergelyOrosz:这非常有趣。Coinbase 似乎通过1)路由到便宜的推理模型……将其代币花费($$)降低到了大约一半

X AI KOLs Following · 2026-06-27 缓存

据报道,Coinbase 通过智能路由到更便宜的模型(如 GLM 5.2 和 Kimi 2.7)以及实现缓存,将 AI 代币花费减少了一半,凸显了 AI 成本优化的趋势。

0 人收藏 0 人点赞
#caching

@techNmak: 你的LLM推理正在消耗50%的计算资源在已经完成的工作上。如果你正在运行RAG或多轮对话,……

X AI KOLs Timeline · 2026-06-24 缓存

LMCache是一个开源库,它使KV缓存持久化并可在请求之间共享,消除了RAG和多轮对话工作负载中的重复计算,实现了高达15倍的吞吐量提升和3-10倍的首令牌时间减少。

0 人收藏 0 人点赞
#caching

多层级MoE缓存

Reddit r/LocalLLaMA · 2026-06-23

讨论MoE模型的多层级缓存策略,通过将频繁激活的专家保留在GPU上来提升推理速度,参考了PowerInfer和llama.cpp分支等现有实现。

0 人收藏 0 人点赞
#caching

在 Transformers.js 中尝试提议的跨源存储 API

Hugging Face Blog · 2026-06-23 缓存

这篇客座文章探讨了提议的跨源存储API,用于改进Transformers.js中AI模型资源的缓存,从而实现跨源的高效复用,同时保持浏览器内推理的隐私和完整性。

0 人收藏 0 人点赞
#caching

@0x_kaize: https://x.com/0x_kaize/status/2068775813785506091

X AI KOLs Timeline · 2026-06-21 缓存

关于在使用 GLM 5.2 模型时避免速率限制和降低成本的指南,涵盖提示批处理、缓存、免费模型替代方案、努力水平、上下文窗口管理和自托管。

0 人收藏 0 人点赞
#caching

@venkat_systems: 推理不仅仅是GPU/加速器的问题。热路径中未经优化的CPU工作会极大影响性能。v0.…

X AI KOLs Timeline · 2026-06-19 缓存

Venkat 解释道,热路径中未经优化的CPU工作会严重影响推理性能,并介绍了他在 mooncake 中提交的PR,该PR添加了一个内存池,用于实现无锁、无分配的操作,使 vLLM 和 SGL 项目受益。

0 人收藏 0 人点赞
#caching

@NFTCPS: 兄弟们,用 DeepSeek V4 Pro 跑 Codex 的,token 烧得心疼吧?这俩 skill 你必须知道。 token-saver:改完代码只回个路径加 done,废话一句没有,实测能省 60-80% token memory…

X AI KOLs Timeline · 2026-06-18 缓存

为DeepSeek V4 Pro优化的Codex技能,通过冻结skill文件和极简输出可节省60-80% token,并提供跨对话持久记忆功能。

0 人收藏 0 人点赞
#caching

RFC 10008: HTTP QUERY 方法

Lobsters Hottest · 2026-06-18 缓存

RFC 10008 定义了新的 HTTP QUERY 方法,允许包含请求体的安全、幂等且可缓存的请求,解决了 GET 和 POST 在 RPC 风格 API 中的局限性。

0 人收藏 0 人点赞
#caching

@realchendahuang: 我感觉大家对 Cloudflare 的开发程度依然不足 1%。 它现在出了太多的功能。 对象存储用 R2。 后端 API 用 worker。 AI 网关用 AI Gateway。 重计算的,用 Container。 缓存用 KV。 数据库…

X AI KOLs Timeline · 2026-06-15 缓存

本推文介绍了Cloudflare提供的多种开发功能,包括对象存储R2、后端API Worker、AI网关AI Gateway、容器、缓存KV、数据库D1和PostgreSQL连接HyperDrive等,强调其价格便宜、功能丰富且免费额度充足。

0 人收藏 0 人点赞
#caching

CacheRL:基于缓存回滚和混合奖励的多轮工具调用智能体

arXiv cs.CL · 2026-06-15 缓存

CacheRL训练用于多步工具调用任务的小型智能体基础模型,通过缓存回滚和混合奖励塑造,以100倍更少的计算量实现了92%的过程准确率(接近GPT-5的94%),并在知识迁移、缓存感知奖励以及迭代SFT/GRPO训练方面进行了创新。

0 人收藏 0 人点赞
#caching

如何高效构建 Microsoft AI agent framework

Reddit r/AI_Agents · 2026-06-14

关于在 Microsoft Agent Framework 中通过使用网关进行缓存、上下文压缩和模型路由来优化成本的实用指南,确保每个步骤仅使用必要的智能。

0 人收藏 0 人点赞
#caching

缓存如何每月帮我们节省数百美元的AI成本

Reddit r/AI_Agents · 2026-06-10

本文介绍了通过构建智能缓存网关(Hawiyat Composer)如何利用精确匹配缓存、语义缓存、模型路由和本地路由消除重复的token浪费,从而节省大量AI API成本。

0 人收藏 0 人点赞
#caching

人们如何在AI代理工作流中减少token浪费?

Reddit r/AI_Agents · 2026-06-10

讨论了AI代理工作流中由于重复上下文导致的token浪费问题,介绍了一个名为Badgr-auto的开源代理用于去重,并询问社区如何应对该问题。

0 人收藏 0 人点赞
#caching

通过向量化和缓存加速NeurASP

arXiv cs.AI · 2026-06-10 缓存

本文通过实现向量化、批处理和缓存来加速NeurASP神经符号AI框架,在较大任务上实现了多个数量级的提速。

0 人收藏 0 人点赞
#caching

@MinLiBuilds: 1. 这才是真正的 fork。 子窗口享受 100% 缓存,智能,免费。 比 Claude Code 搞得丝滑 100 倍。 支持了真正的 fork/branch。 在任意一个 terminal,command+F, 基于当前对话历史,f…

X AI KOLs Timeline · 2026-06-08 缓存

MinLiBuilds 发布了一个真正的 fork 功能,允许在终端中基于对话历史通过 Command+F 创建全新的子窗口,支持多层 fork,并声称比 Claude Code 更丝滑、享受 100% 缓存且免费。

0 人收藏 0 人点赞
#caching

@VincentLogic: 一个程序员突发奇想: DNS 解析器会把域名记几天—— 那能不能拿来存文件? ↓ 他找到了全网 390 万个开放 DNS 解析器 把文件切碎 撒遍整个互联网 没有硬盘 没有数据库 没有云 文件活在无数台服务器的缓存里 而那些服务器根本不知…

X AI KOLs Timeline · 2026-06-07 缓存

一个程序员利用全网390万个开放DNS解析器的缓存来存储文件碎片,创建了一个名为dnsfs的荒诞开源项目,文件随着缓存过期而消失。

0 人收藏 0 人点赞
#caching

@anyscalecompute:GPUs在孟买,训练数据在爱荷华?跨区域读取在每个训练周期都带来开销。我们将@Alluxio NVMe缓存放在…

X AI KOLs Following · 2026-06-04 缓存

Anyscale展示了通过使用Alluxio NVMe缓存和Ray Data,跨区域训练数据读取速度提升了20倍,显示1TB数据的缓存预热读取时间从4,241秒降至208秒。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈