这些人简直疯了。
摘要
本文讨论了一个产品的beta测试,该产品提供1000次免费Recalls和高达150倍的token成本降低,具有可无限扩展的Memory Banks,可在不同会话和模型中使用。
我试用了他们的beta测试,天哪,太疯狂了。虽然他们的免费层级只有1000次Recalls,但我看到token成本节省高达150倍。更棒的是,他们的Memory Banks可以无限扩展,并且可以被任何会话和跨模型使用。有人见过类似的产品吗?
相似文章
@simplifyinAI:腾讯刚刚开源了Hy-Memory。一个内存插件,通过6层框架赋予AI代理真正的长期记忆…
腾讯开源了Hy-Memory,这是一个为AI代理提供长期记忆的内存插件,采用6层双推理框架,将令牌使用量减少35%,内存膨胀减少70%。
我消耗了所有代币来研究如何节省代币
作者描述了如何通过多个订阅和更便宜的模型构建自定义AI研究管线以降低代币成本,并在研究代币经济学的过程中亲身体验了如何优化代币使用。
@draecomino: Cerebras 创下新纪录:万亿参数模型,每秒 1000 个 token
Cerebras 宣布,在企业试用中,其运行万亿参数模型 Kimi K2.6 的速度约为每秒 1000 个 token,并声称这是 Artificial Analysis 有史以来测得的最快前沿模型性能。
使用 Intel Optane Persistent Memory 组装的电脑 – 能以超过 4 tokens/秒的速度运行 1 万亿参数模型
一位社区成员详细介绍了这款定制 PC 组装方案,利用已停产的 Intel Optane Persistent Memory,成功通过 llama.cpp 在本地以约 4 tokens/秒的速度运行了 1 万亿参数的 Kimi K2.5 模型。
@DeRonin_: https://x.com/DeRonin_/status/2054235707791778034
一份实用指南,介绍了如何通过更智能的 Token 管理(包括多模型路由、提示词缓存和上下文纪律)来降低 80% 的 AI 编码成本,而不是简单地切换到更便宜的模型。