gpu-scaling

标签

Cards List
#gpu-scaling

@PyTorch: 在 @vllm_project 中的弹性专家并行性允许您在活动的混合专家部署期间动态添加或移除GPU…

X AI KOLs Following ↗ · 14小时前 缓存

本文推广了在2026年PyTorch Conference North America上关于vLLM中弹性专家并行性的演讲,讨论了如何在混合专家部署中动态添加或移除GPU,同时最小化停机时间。

0 人收藏 0 人点赞
#gpu-scaling

@charles_irl: 之后,人们一直问我们 @modal 是如何能够如此出色地提供代理推理服务的。所以我们把这一切都写了下来。新博…

X AI KOLs Timeline ↗ · 3天前 缓存

Modal 详细介绍了他们如何为万亿参数编码代理优化推理性能,为其服务在吞吐量和交互性方面实现了显著提升。

0 人收藏 0 人点赞
#gpu-scaling

@radixark: SGLang-Diffusion 支持快速、可扩展的多模态生成推理。最新的 VDN-H3 工作使 @MiniMa…

X AI KOLs Timeline ↗ · 2026-09-14 缓存

SGLang-Diffusion 与 MiniMax 的 VDN-H3 支持快速、可扩展的视频生成,在 8× B200 GPU 上,仅需 9.0 秒即可生成 14.4 秒的 768p 视频,实现比实时更快的推理。

0 人收藏 0 人点赞
#gpu-scaling

@quasagroup: Modal Review: Run AI Workloads Without Managing Servers https://youtu.be/a8vuwYK90-Q?si=vYj7YpobSXGNCDpQ… via @YouTube

X AI KOLs Timeline ↗ · 2026-07-24 缓存

Modal 是一个专为 AI 工作负载设计的无服务器云平台,支持推理、训练和沙箱,通过纯 Python 代码实现从零到上千 GPU 的瞬间扩展,大幅降低延迟并加速产品上市。

0 人收藏 0 人点赞
#gpu-scaling

再加一张GPU就获得近乎线性的扩展?有点奇怪

Reddit r/LocalLLaMA ↗ · 2026-06-08

一位用户报告称,在使用Qwen模型进行推理时,添加第二张RTX 3090后实现了近乎线性的性能扩展,在没有NVLink的情况下,解码TPS提升了约1.8倍。

0 人收藏 0 人点赞
#gpu-scaling

@THayes427: 另外请查看这个@modal教程,它详细讲解了上面笔记本中的底层代码,并提供了更多详细解释…

X AI KOLs Following ↗ · 2026-06-02 缓存

一个Modal教程,展示如何使用ESMFold2和ESMC模型扩展蛋白质绑定剂设计,包含用于迭代优化和自动伸缩基础设施的代码。

0 人收藏 0 人点赞
#gpu-scaling

深度学习基础设施

OpenAI Blog ↗ · 2016-08-29 缓存

OpenAI 分享了他们的深度学习基础设施方法,并开源了 kubernetes-ec2-autoscaler,一个为 Kubernetes 优化的批处理自动扩展管理器,强调基础设施质量如何倍增研究进展。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈