@xinyzng:有趣的是,@MicrosoftAI 不仅将 Ray actors 用于控制器和 rollout 工作节点,还将它们用于问题工作节点,以进行...
摘要
该推文讨论了微软 AI 使用 Ray actors 训练 MAI-Thinking-1 模型,实现了对异构计算的更细粒度控制,并更好地利用了 GPU 集群中闲置的 CPU 资源。
有趣的是,@MicrosoftAI 不仅将 Ray actors 用于控制器和 rollout 工作节点,还将它们用于问题工作节点,以进行 MAI-Thinking-1 模型的后期训练。与引入 @modal 等第三方沙箱依赖不同,Ray actors 能够提供更细粒度的异构计算控制,从而更好地利用 GPU 集群中未使用的 CPU 资源,并简化代理执行结果的通信。此外,我参与的部分工作是支持 @sgl_project 与 @raydistributed 后端,以更好地强化学习基础设施,特别是在权重同步方面。
相似文章
@raydistributed: 祝贺微软 AI 团队推出 MAI-Thinking-1!很高兴看到 Ray 在前沿模式的多个部分中被使用…
微软 AI 发布了 MAI-Thinking-1,一个拥有 350 亿活跃参数/1 万亿总参数的 MoE 推理模型,在 STEM 和编码任务上具有竞争力,使用 Ray 进行分布式训练和编排。
@RayFernando1337: https://x.com/RayFernando1337/status/2070621713952579990
关于是在本地运行AI模型还是通过API运行的详细分析,涵盖了RTX 5090、RTX PRO 6000和DGX Spark等硬件选项,重点讨论了内存与带宽的权衡、成本考虑以及隐私需求。
AI 战争正从模型转向硬件,但我觉得讨论得远远不够
一篇评论文章认为,AI 竞争正从模型质量转向硬件部署与基础设施。文中指出,微软的 Project Solara、英伟达的 RTX Spark 以及字节跳动自研 CPU 等案例表明,智能体工作负载正推动着硅片与部署策略的革新。
@anyscalecompute:大多数 Agent 框架解决了编排问题,却在基础设施方面完全未予解决。最新博文:面向生产的 AI…
Anyscale 发布了一篇技术指南,介绍如何使用 Ray Serve、MCP 和 A2A 协议部署面向生产环境的 AI Agent。文章针对常见的底层基础设施瓶颈,提出了一种解耦的微服务架构,支持 LLM、工具与 Agent 的独立扩缩容。
微软如何大规模投产数千个AI代理(18分钟阅读)
微软分享了从原型到生产过程中,在企业级规模下部署数千个AI代理的工程经验,涵盖代理框架、检索即子代理、代理身份以及基于评估标准的自动化优化循环等关键挑战。