标签
阿里巴巴 Qwen 和阿里云的 Qwen3.8-2.4T-A95B 现已登陆 Modal,配备基于工具调用密集型数据训练的自定义 DFlash 推测器和完整的 1M 上下文窗口。
DeepSeek-V4-Flash 是一个 284B 参数的 MoE 模型,每 token 激活 13B 参数,采用混合压缩注意力机制,可降低 1M token 上下文的 KV 缓存需求。可使用 Modal 上的 SGLang 提供服务,在单个 B300 上实现快速解码。
Kimi K3 是一款开源模型,在智能体编码基准测试中领先,具备原生视觉和 100 万 token 的上下文窗口,现在可以通过 Modal 的 Shared Endpoint 在 Codex 中运行。
Thinking Machines 发布了 Inkling-Small,这是一个 276B 参数的混合专家模型,具有 12B 激活参数、1M 上下文以及原生图像/音频理解能力,现已在 Modal 上可用,并支持 NVIDIA B300。
Modal的首席技术官Akshat Bubna澄清,涉及恶意代理的安全事件是由客户未经身份验证的端点导致的,并非Modal平台隔离遭到破坏。
Modal 是一个专为 AI 工作负载设计的无服务器云平台,支持推理、训练和沙箱,通过纯 Python 代码实现从零到上千 GPU 的瞬间扩展,大幅降低延迟并加速产品上市。
Modal 宣布其首届年度大会 Runtime 将于 10 月 1 日在旧金山的 The Midway 举行。
无服务器 GPU 的每小时费率可能更高,但根据工作负载的峰值与平均需求比,总体而言可能更具成本效益。Modal 博客上的这篇文章用一个小组件进行了说明。
Charles在飞往首尔参加ICML的航班上写了一篇文章,解释了什么是Modal。
在一系列推文中,Modal 的创始人解释说,这个平台最好被理解为一台计算机,并将传统计算机架构与 Modal 的无服务器云基础设施进行了类比。
Matt Pocock 称赞原型设计工具 Wayfinder 的 AI 驱动模态框,可随时随地编辑课程文本。
Modal 宣布与 Claude Science 集成,为生命科学研究人员提供弹性计算基础设施,并承诺提供高达 10 万美元的资源。
Yong Quan 强调,更好的推测解码器可以在 LLM 推理中实现近乎线性的吞吐量提升,该观点由 Charles 在 Modal 研讨会上提出。
Modal 宣布推出 Auto Endpoints,实现轻松推理,开发者 Anthony Corletti 称赞其为计算、存储和网络之上的一流抽象。
Modal推出了Auto Endpoints,这是一项自助服务,提供优化的、生产级的LLM推理,具备完整代码所有权、透明指标和自动缩放功能,构建于其无服务器GPU基础设施之上。
Modal宣布向所有用户开放托管的私有LLM端点,支持通过UI或CLI轻松部署,并且客户可以完全访问底层代码。
Modal 宣布推出 Auto Endpoints,这是一项可通过一键实现优化的开源 AI 推理的服务,旨在对抗专有模型和服务的趋势。
Modal 宣布推出 Auto Endpoints,这是一个用于拥有和部署 AI 推理的新功能。