标签
Modal 是一个专为 AI 工作负载设计的无服务器云平台,支持推理、训练和沙箱,通过纯 Python 代码实现从零到上千 GPU 的瞬间扩展,大幅降低延迟并加速产品上市。
探讨了人工智能智能体的不同长期记忆架构,重点关注使用 neon postgres 的智能体即内存控制器方法。
Runpod 发布 FlashBoot,一种针对 AI 模型的无服务器方案,将空闲模型迁移到更便宜的存储,并在需要时将其调回 GPU,冷启动时间低于 200 毫秒,相比传统云服务降低成本 90%。
本文提出了一种面向无服务器环境的依赖感知自动缩放框架,集成了基于图的瓶颈识别、通过概率集成的多模型预测(MLP、LSTM、CNN)以及成本感知的缩放控制。实验表明,预测准确率达到99.88%,并降低了基础设施成本。
Telegram 推出一个面向机器人和 Mini Apps 的无服务器平台,让开发者能够在 Telegram 的基础设施上运行 JavaScript 代码,无需管理服务器。
Google 正式发布 Cloud Run 沙箱,展示了在5秒内启动、执行并停止1000个沙箱的能力,平均延迟为500毫秒。
Modal的目标是成为全球计算和资源管理的聚合器,就像一个超大型全球计算机。
Charles在飞往首尔参加ICML的航班上写了一篇文章,解释了什么是Modal。
在一系列推文中,Modal 的创始人解释说,这个平台最好被理解为一台计算机,并将传统计算机架构与 Modal 的无服务器云基础设施进行了类比。
Cerebrium 通过检查点 CPU 和 GPU 内存,减少 AI 工作负载的 GPU 冷启动,在数秒内恢复完全初始化的容器,将启动时间缩短超过 80%。
FlareMo是一个基于Cloudflare Workers的个人笔记系统,利用免费套餐实现零服务器运维,支持Flomo风格的时间线笔记、标签、附件、搜索等功能。
Vercel 现在支持运行任意 Dockerfile,允许开发者直接在 Vercel 的 Fluid 计算平台上部署容器化的 HTTP 服务(Go、Rails、Spring Boot 等),具备自动扩展、预览部署和按 CPU 使用付费的功能。
Vercel 宣布推出 Services,允许用户在一个项目中使用原子部署、回滚、预览 URL 和内部网络并置多个后端和前端服务。
Fireworks AI 宣布推出 Serverless 2.0,引入三个服务层级(标准、优先、快速),无需预先配置 GPU 即可处理流量拥塞,通过按请求路由实现可靠性和成本效益。
Modal 宣布推出由 Modal Servers 驱动的新 Auto Endpoints 功能,详细介绍了使用 EnvoyProxy、Google Cloud Spanner 和 Cloudflare Pingora 的架构。
Modal 宣布推出 Auto Endpoints,实现轻松推理,开发者 Anthony Corletti 称赞其为计算、存储和网络之上的一流抽象。
Modal推出了Auto Endpoints,这是一项自助服务,提供优化的、生产级的LLM推理,具备完整代码所有权、透明指标和自动缩放功能,构建于其无服务器GPU基础设施之上。
Modal 宣布推出 Auto Endpoints,这是一个用于拥有和部署 AI 推理的新功能。
AWS Lambda 宣布推出 MicroVMs,这是一种新的无服务器计算原语,提供隔离、有状态的执行环境,具备虚拟机级别的隔离和近乎瞬时的启动,由 Firecracker 驱动。
本教程介绍如何利用Cloudflare的免费Serverless服务(包括Pages、KV)零成本搭建高速私人VLESS节点,实现流畅观看4K/8K视频和访问AI服务。