标签
Rivet工程师详细介绍了他们如何为SQLite构建零磁盘、S3分层的存储引擎,实现了隔离数据库,具备即时启动、低延迟写入、时间点恢复和无限存储能力,可支持数百万Actors。
DigitalOcean推出了LLM推理的提示缓存功能,自动缓存系统提示等重复上下文,无需更改代码即可将输入令牌成本降低多达80%,并附有关于盈亏平衡计算的详细教程。
Kedge 是一个全球分布式云平台,提供硬件隔离的虚拟机、全局SQLite数据库、无服务器函数以及按秒计费的自动扩缩容。它旨在简化靠近用户的全栈应用部署。
MCP 迎来重大更新,核心协议全面无状态化,告别 session 和长连接,更适合 serverless、边缘部署与横向扩容,被称为自发布以来最大更新。
camelAI重写了他们的编码智能体,使其完全在Cloudflare Durable Object中运行,使用SQLite和R2作为文件系统,并用JavaScript替代了bash。从虚拟机迁移降低了成本和延迟,代码库现已开源。
本文比较了无服务器、本地和边缘部署三种 AI 模型部署方式,指出了当前多模型服务中的低效问题。它介绍了 Superlinked Inference Engine (SIE),一个开源工具,通过动态加载和卸载权重,在单个 GPU 上服务多个模型,旨在降低成本和复杂性。
一种针对地理分布式无服务器云提出的受SLA约束的碳感知路由策略,在真实的AWS部署评估中,实现了高达46.8%的碳减排,同时保持零SLA违规。
Modal 是一个专为 AI 工作负载设计的无服务器云平台,支持推理、训练和沙箱,通过纯 Python 代码实现从零到上千 GPU 的瞬间扩展,大幅降低延迟并加速产品上市。
探讨了人工智能智能体的不同长期记忆架构,重点关注使用 neon postgres 的智能体即内存控制器方法。
Runpod 发布 FlashBoot,一种针对 AI 模型的无服务器方案,将空闲模型迁移到更便宜的存储,并在需要时将其调回 GPU,冷启动时间低于 200 毫秒,相比传统云服务降低成本 90%。
本文提出了一种面向无服务器环境的依赖感知自动缩放框架,集成了基于图的瓶颈识别、通过概率集成的多模型预测(MLP、LSTM、CNN)以及成本感知的缩放控制。实验表明,预测准确率达到99.88%,并降低了基础设施成本。
Telegram 推出一个面向机器人和 Mini Apps 的无服务器平台,让开发者能够在 Telegram 的基础设施上运行 JavaScript 代码,无需管理服务器。
Google 正式发布 Cloud Run 沙箱,展示了在5秒内启动、执行并停止1000个沙箱的能力,平均延迟为500毫秒。
Modal的目标是成为全球计算和资源管理的聚合器,就像一个超大型全球计算机。
Charles在飞往首尔参加ICML的航班上写了一篇文章,解释了什么是Modal。
在一系列推文中,Modal 的创始人解释说,这个平台最好被理解为一台计算机,并将传统计算机架构与 Modal 的无服务器云基础设施进行了类比。
Cerebrium 通过检查点 CPU 和 GPU 内存,减少 AI 工作负载的 GPU 冷启动,在数秒内恢复完全初始化的容器,将启动时间缩短超过 80%。
FlareMo是一个基于Cloudflare Workers的个人笔记系统,利用免费套餐实现零服务器运维,支持Flomo风格的时间线笔记、标签、附件、搜索等功能。
Vercel 现在支持运行任意 Dockerfile,允许开发者直接在 Vercel 的 Fluid 计算平台上部署容器化的 HTTP 服务(Go、Rails、Spring Boot 等),具备自动扩展、预览部署和按 CPU 使用付费的功能。
Vercel 宣布推出 Services,允许用户在一个项目中使用原子部署、回滚、预览 URL 和内部网络并置多个后端和前端服务。