标签
PyTorch 官方博客发布了面向 PyTorch Conference North America 2026(圣何塞)的 Ray 专题指南,重点介绍来自 Anyscale、Google、LinkedIn、Pinterest 和 Uber 的演讲嘉宾带来的主旨演讲与会议内容,涵盖 Ray 与 Kubernetes 的协同发展、弹性训练栈以及可扩展的强化学习(RL)。
This article demonstrates how to pool RAM from old devices to run a larger local AI model and build a private chatbot using custom knowledge from PDFs, ensuring all data remains local.
本文探讨了构建社区拥有的人工智能以与企业前沿竞争的理念,参考了开源软件模型,并建议使用如Petals这样的技术进行分布式GPU计算,同时强调组织挑战大于技术挑战。
DeepSeek Elastic Compute (DSec) 是专为大规模大语言模型有效代理训练设计的沙盒基础设施,具备弹性执行、统一SDK,并支持与强化学习框架集成。
本文探讨了去中心化AI作为中心化系统替代方案的概念,并回顾了联邦学习和分布式计算的研究,这些研究可能实现AI的集体所有权。
PyTorch 2.14版本引入了容错性作为c10d的一等概念,支持进程组的原地重配置,同时带来了NVGEMM内核、新的nccl2后端以及Apple Silicon的原生线性代数等特性。
NVIDIA在IFA上宣布了PAIR,这是一个工具,可自动链接本地网络系统,分配推理请求,以实现高效的AI代理操作。
Nvidia 已推出 PAIR,这是一个开源工具,可连接闲置的家庭计算机,创建个人AI数据中心,用于分布式本地AI推理任务,支持智能体工作流。
本文提出一种针对通用编码计算的流形感知编码策略,该策略利用高维数据的内在低维几何结构来提高分布式系统中的抗滞后性。实验表明,在神经网络推断和多项式求值任务中,该策略显著降低了均方恢复误差。
PyTorch 2.14 引入了对 Inductor、PyTorch Distributed、动态形状、Apple Silicon 支持等方面的更新,并有现场问答和 PyTorchCon 公告。
本文介绍了通用编码计算(GCC),一种学习理论框架,用于缓解分布式计算系统中的掉队节点问题,并提供了理论性能保证和在深度神经网络上的实验验证。
一个交互式、可探索的解释,介绍各种用于训练Transformer的并行化方案,改编自关于模型扩展的学术内容。
跨多台机器运行编码智能体表明,管理控制平面比管理智能体本身更具挑战性,为分布式智能体编排提供了洞见。
Prime Intellect工程师演示了一种方法,通过开放互联网使用分布式强化学习在30分钟内训练推理模型,利用Prime-RL、LLM评判器和多云GPU,使开放模型无需拥有数据中心即可与封闭实验室竞争。
Mesh LLM 是一个分布式AI计算平台,它聚集多台机器上的闲置GPU来运行大型语言模型,并暴露单一的OpenAI兼容API。该平台利用iroh的点对点网络,实现无需中央服务器的私有、去中心化推理。
本文重新审视了 SETI@home 分布式计算模型,将其作为利用闲置的办公和家用电脑处理任务,从而缓解对新数据库中心需求的潜在解决方案。
本文研究了OLS回归中的分布式草图化方法,该方法不是对整个数据集构建草图,而是基于分区子集构建,从而降低计算成本。作者刻画了平均估计量的精确超额损失,并表明当子集协方差散度较小时,该损失与全数据草图化的损失相当。