@PyTorch:Lablup (@lablupinc) 作为银牌会员加入 PyTorch 基金会,推动开源人工智能!@lablupinc 开发软件…
摘要
Lablup 已作为银牌会员加入 PyTorch 基金会,以推进开源人工智能。他们开发 Backend.AI,这是一款用于 AI 基础设施的软件工具,支持 GPU 编排和虚拟化。
查看缓存全文
缓存时间: 2026/09/03 02:04
Lablup (@lablupinc) 已正式加入 PyTorch 基金会,成为银牌会员,以推动开源人工智能的发展!
@lablup 开发的软件为人工智能提供支持——从桌面设备到数据中心。通过 http://Backend.AI,任何人都能以合适的成本和规模选择、连接并运行AI模型。
“Lablup 自创立之初便将 http://Backend.AI 作为开源项目开发。PyTorch 是我们这项工作的核心。加入基金会是我们回馈这个长期支持我们的生态系统的方式。”
—— Lablup 首席执行官 申正奎
Backend.AI | AI 基础设施操作系统:GPU 编排与虚拟化
来源:https://www.backend.ai/
统一的AI基础设施操作系统
您专注于创造卓越的AI——我们来处理后端事宜。
我们的专长
化繁为简,轻松运维
Backend.AI 使您能够构建、训练和部署任何类型、任何规模、任意体量的 AI 模型。在同一个统一环境中轻松运行并行计算任务、训练深度学习模型并部署推理服务。从分片式 GPU 共享到拥有数千个 GPU 的多节点集群,优化您的基础设施,榨干每一滴算力。
化繁为简,轻松运维
采购 GPU 只是最简单的一步
最常见的企业级 GPU 基础设施挑战以及 Backend.AI 如何解决它们。
GPU 利用率未达满载
投入数十亿美元建设的 GPU 基础设施,利用率却很少超过 30%。团队分配了 8 块 GPU 却仅使用 2 块,这种现象在整个组织中普遍存在。
了解我们的解决方案→
分片式 GPU:榨干每一算力单元 将物理 GPU 切分为精确的分数切片,实现并发多用户共享。兼容所有 NVIDIA GPU,开销低于 5%。
A 公司 GPU 利用率 30% → 85%(提升 2.8 倍)
多团队共享 GPU 困难重重
多个团队共享一个 GPU 集群,却没有明确的分配策略。紧急实验因其他团队闲置资源而受阻。
了解我们的解决方案→
四层多租户体系,公平分配资源 在组织、部门、项目和用户级别进行分层资源管理。闲置资源通过动态分配自动重新调度。
B 大学 无需管理员干预,实现资源自动化管理
云部署受限
处理敏感信息限制了对外部云 AI 服务的采用。AI 必须在气隙环境中运行。
了解我们的解决方案→
完全独立的气隙运行 安装、模型部署和更新均可在无互联网连接的情况下进行。多层安全沙箱满足金融和国防级安全要求。
C 银行 气隙环境下的LLM运行
面临 GPU 定价与供应短缺挑战
不断上涨的 GPU 价格和供应短缺促使业界关注 AMD、Intel 和国产 NPU,但平台依赖性使得脱离特定生态系统变得困难。
了解我们的解决方案→
统一接口,支持12家以上供应商 硬件抽象层 (HAL) 通过单一控制平面管理 NVIDIA、AMD、Intel、Google TPU、Rebellions、FuriosaAI、Tenstorrent 等更多厂商。
D 公司 将在 Backend.AI 上引入国产 NPU 用于其 GPUaaS 业务
必须跟上不断增长的 GPU 需求
AI 服务扩展需要更多 GPU,但从数十台节点扩展到数百台引入的复杂性是现有工具无法处理的。
了解我们的解决方案→
Sokovan 编排器,与您同步扩展 Sokovan 调度器可处理任何规模的多节点、多租户工作负载。GPU 和存储基础设施实现无缝扩展,无需重新架构。
E 大学 增加 256% 的 GPU 节点
团队越多,混乱指数级增长
随着团队扩大,优先级冲突和队列问题随之出现。人员流动也存在丢失操作知识的风险。
了解我们的解决方案→
从容应对可扩展基础设施的软件 Backend.AI 通过基于策略的管理实现 GPU 运维自动化。资源配额、调度规则和访问控制均定义为策略,实现高效运营。
F 大学 以最少的人员运营校园基础设施
我们的核心
Sokovan。见识真正懂AI工作负载的专家
隆重介绍 Sokovan,专为 AI 基础设施打造、最强大的容器化工作负载编排器,从设计之初就为 AI 考虑。其核心是管理者-代理双层调度系统,旨在最大化多租户环境下的硬件利用率、性能和运营效率。
探索 Sokovan→ (https://www.backend.ai/platform/sokovan)
Sokovan。见识真正懂AI工作负载的专家
从闲置到理想
容器级 GPU 虚拟化
Backend.AI 的专利技术在容器内部拦截 CUDA API 调用,从而在软件层面精确控制 GPU 资源。多个用户可在确保工作负载完全隔离的前提下,安全共享单块物理 GPU。
提升 400% GPU 利用率
降低 75% 基础设施成本
了解更多→ (https://www.backend.ai/platform/gpu-virtualization)
GPU 利用率对比
多用户 GPU 共享 用户 A 0.25 GPU 用户 B 0.5 GPU 用户 C 0.15 GPU 用户 D 0.1 GPU
硬件自由
支持12家以上AI加速器的厂商中立平台
Backend.AI 通过硬件抽象层 (HAL) 在单一统一接口下管理 12 种以上的 AI 加速器类型,包括 NVIDIA Blackwell、Intel Gaudi、AMD Instinct、Rebellions ATOM+ 以及 FuriosaAI RNGD。无论底层硬件如何,均可使用相同的工作流进行开发、训练和部署。
智能平台,洞悉存储
统一接口,兼容任意存储。
无论后端存储是 VAST、WEKA、PureStorage、IBM Storage Scale 还是其他系统,访问数据的方式始终如一。借助 NVIDIA GPUDirect Storage 支持,数据可直接从存储传输至 GPU 显存。
了解更多→ (https://www.backend.ai/platform/storage)
消除鸿沟
气隙网络中的完整AI环境
Reservoir AI(模型中心)+ Reservoir(软件包仓库) 即使在气隙网络中,也能保持 AI 模型和工具的最新状态。Reservoir 为隔离的 AI 基础设施完善了软件供应链。
探索 Reservoir→ (https://www.backend.ai/ecosystem/reservoir)
气隙网络边界
Backend.AI 控制平面
控制层 API 网关 认证 / RBAC 调度器
数据层 Reservoir AI Reservoir
GPU 节点 H100 H100 A100 A100 B200 B200 B200
直观的 Web 管理界面
降低 GPU 利用与运维的门槛
Backend.AI WebUI 让您通过浏览器管理 GPU 集群、监控资源和治理多租户环境,无需掌握 CLI 技能。从会话管理到基于策略的资源分配,一切都在统一界面中完成。
探索 WebUI→ (https://www.backend.ai/platform/webui) 降低 GPU 利用与运维的门槛
NVIDIA DGX-Ready 软件
专为 NVIDIA DGX 打造,经认证可在企业级规模运行
作为 NVIDIA DGX-Ready 软件,Backend.AI 能与 NVIDIA DGX 系统和 Grace Blackwell 实现无缝协同运行。容器级 GPU 虚拟化结合 Sokovan 编排器,可在各种规模下优化 AI 和 HPC 工作负载的利用率。
探索 DGX-Ready→ (https://www.backend.ai/platform/dgx-ready)
专为 NVIDIA DGX 打造,经认证可在企业级规模运行
在任何环境中均能稳定运行
选择适合您组织安全策略和基础设施的部署模型:本地部署、云部署或混合部署。
本地部署
所有数据和工作负载均在您自己的数据中心内处理。即使在气隙环境中也能独立运行。
- 完全的数据主权
- 支持气隙环境
- 易于满足合规要求
云部署
在 AWS、GCP、Azure 和 OCI 等公有云上的 GPU 实例上运行。零前期投资,即可立即启动。
- 无前期成本,即时启动
- 弹性伸缩
- 全球区域快速部署
混合部署
通过单一控制平面管理本地部署和云环境。将敏感数据保留在本地,同时将工作负载突发至云端。
- 统一的单一控制平面
- 基于策略的工作负载部署
- 保护现有本地投资
仪表盘与管理
监控、管理与掌控一切
all-smi — 集群概览 集群概览 节点 200/200 GPU 核心 1600 总显存 220.3TB 平均温度 68°C 总功耗 684kW 总内存 320.0TB 标签页 node-0001 node-0002 node-0003 … node-0200 GPU 型号 利用率 显存 温度 功耗 GPU H200 141 79.1% 84.2/141GB 78°C 511/700W GPU H200 141 28.8% 90.0/141GB 63°C 420/700W GPU H200 141 36.1% 61.6/141GB 63°C 385/700W GPU H200 141 66.2% 69.3/141GB 75°C 502/700W h:帮助 q:退出 c:CPU →:标签页 s:滚动
仪表盘让您一目了然地监控资源使用情况、会话状态和基础设施健康状况。通过 All-SMI,您可以从单一界面监控包括 NVIDIA、AMD、Intel Gaudi 和 Google TPU 在内的异构加速器和服务器。团队和用户管理功能已内置,便于组织控制。
了解 All-SMI→ (https://www.backend.ai/platform/all-smi)
受行业领袖信赖
VAST Data VAST COSMOS 技术合作伙伴
Everpure Everpure 技术联盟合作伙伴
客户
大学、研究实验室和企业信赖 Backend.AI
从校园实验室到企业数据中心,超过 120 个组织正在体验 Backend.AI 带来的优势。
KT KT 电信/云计算
KT Cloud KT Cloud 电信/云计算
NHN Cloud NHN Cloud 电信/云计算
三星电子 三星电子 IT/电子
LG 电子 LG 电子 IT/电子
CJ AI 中心 CJ AI 中心 IT/电子
新韩银行 新韩银行 金融
韩国银行 韩国银行 金融
现代摩比斯 现代摩比斯 出行
大韩航空 大韩航空 航空
三星 Welstory 三星 Welstory 食品
LIG 国防航空 LIG 国防航空 国防
韩国海军 韩国海军 国防
京畿道 京畿道 政府
三星医疗中心 三星医疗中心 医疗/生物
CNUH CNUH 医疗/生物
HIRA HIRA 医疗/生物
三星研究院 三星研究院 IT/电子
ETRI ETRI 研究/公共
KISTI KISTI 研究/公共
南加州大学 南加州大学 大学
SKKU SKKU 大学
国民大学 国民大学 大学 及更多…
客户案例
基于 Backend.AI 打造的客户案例
全球各地的大学、研究机构和企业正在使用 Backend.AI 变革其 GPU 基础设施。
在 KIST 使用 Backend.AI 加速生物发现> Lablup 的云资源简化了我们的研究操作。借助 Backend.AI 快速、便捷且随处可访问的平台,我们团队无论身处何地都能保持高效工作。郑哲泳博士,化学与生物综合研究中心,CJ实验室,KIST 阅读更多→ (https://www.backend.ai/resources/kist-casestudy)
国民大学扩展 AI 教育规模> 当我们仅有三台 GPU 服务器时,Backend.AI 通过容器级 GPU 虚拟化技术,让 80 多名学生能够同时进行建模练习,且无需专门的管理支持。Cho Yoonho 教授,人工智能、大数据与融合管理系,KMU 阅读更多→ (https://www.backend.ai/resources/kmu-casestudy)
在成均馆大学使用 Backend.AI 运营 HPC 中心> 运行大学超算中心可避免重复支出,并且随着持续升级,将极大地促进整个校园的研究和实践学习。崔亨基主任,超算中心,SKKU 阅读更多→ (https://www.backend.ai/resources/skku-casestudy)
USC 的 AI 研究基础设施> 如果学生无法真正利用学校提供的资源,那么这些资源就没有真正为学生服务。Backend.AI 是一个 AI 基础设施运营平台,使机构资源既可管理又可访问。BD Kim 教授,副首席研究信息官 阅读更多→ (https://www.backend.ai/resources/usc-casestudy)
在 Upstage 使用 Backend.AI 支撑国家前沿 AI 模型> 我们将时间用于开发,而非基础设施,Backend.AI 处理了其余一切。Kyle Yi,联盟负责人,Upstage 阅读更多→ (https://www.backend.ai/resources/upstage-casestudy)
Team Reboott 的 AI 赋能医疗创新> askyour.trade 2.0 是一个智能贸易工作空间,AI 能够理解文档并自主决策。teamreboott 与 Lablup 合作,加速贸易运营的数字化转型。崔成哲,首席执行官,Teamreboott 阅读更多→ (https://www.backend.ai/resources/teamreboott-casestudy)
相似文章
@PyTorch:我们很高兴欢迎 Cambricon(寒武纪)成为 PyTorch 基金会白金会员!Cambricon 遵循“上游…
Cambricon,作为AI芯片先锋,以白金会员身份加入 PyTorch 基金会,通过硬件软件协同优化和上游贡献来增强开源AI基础设施。
@PyTorch:蚂蚁集团已作为黄金会员加入 PyTorch 基金会。通过 @TheInclusionAI,蚂蚁集团致力于开放模型、……
蚂蚁集团已作为黄金会员加入 PyTorch 基金会,致力于开放 AI 模型和基础设施,以使 AI 更易用,并投资于 AReaL 项目。
@PyTorch:Cambricon的Wei Li 在 PyTorch Conference China 2026 上演讲“Towards Device-agnostic PyTorch: Building Unif…”
Cambricon 作为白金成员加入 PyTorch 基金会,在 PyTorch Conference China 2026 上介绍构建面向多后端生态系统的设备无关 PyTorch 基础设施,并为开源 AI 开发做出贡献。
@PyTorch: 通过将 PyTorch、vLLM、DeepSpeed、Ray、Helion 和 Safetensors 整合到一个中立的供应商管理框架下,……
PyTorch 基金会现已扩展,托管六个开源 AI 项目(PyTorch、vLLM、DeepSpeed、Ray、Helion 和 Safetensors),以在整个 AI 生命周期中提供中立的供应商治理,应对企业在推理、安全性和可扩展性方面的挑战。
@PyTorch: PyTorch Foundation 是 Agentic AI Summit 2026 的金牌赞助商。PyTorch Foundation 的 CTO Matt White 将主持“The O…”
PyTorch Foundation 是 Agentic AI Summit 2026 的金牌赞助商,该峰会由 Berkeley RDI 主办,为期两天。PyTorch Foundation 的 CTO Matt White 将主持一场关于利用开源和可组合性构建 AI 系统的工作坊。