标签
由于本地AI工作负载的需求旺盛,苹果Mac Mini持续面临供应限制,高内存配置的出货时间延长至三个月,第三方零售商价格也更高。
SkyPilot是一个开源工具,可自动在18个云提供商中寻找并配置最便宜的GPU用于AI工作负载,通过竞价实例和自动管理将成本降低高达10倍。
Modal 是一个专为 AI 工作负载设计的无服务器云平台,支持推理、训练和沙箱,通过纯 Python 代码实现从零到上千 GPU 的瞬间扩展,大幅降低延迟并加速产品上市。
在双 RTX 3090 上测试 NVLink 用于 AI 推理和训练,发现张量并行提示处理(30%)和 FSDP 训练(3 倍)有显著加速,但对令牌生成或分层推理影响极小。
AMD 发布了 ROCm 7.14 'TheRock' 技术预览,带来了AI训练增强、针对Comfy UI等特定AI工作负载的性能提升高达16%,以及对开源GPU计算堆栈的持续Windows支持。
关于从双RTX 3090升级到替代方案(如双A6000、RTX 5090或48GB RTX 4090)的讨论,可能用于AI/ML工作负载。
无服务器 GPU 的每小时费率可能更高,但根据工作负载的峰值与平均需求比,总体而言可能更具成本效益。Modal 博客上的这篇文章用一个小组件进行了说明。
Hugging Face Storage现已成为SkyPilot的一级后端,允许用户将Hugging Face仓库和存储桶挂载到任何云上的任务中,无需支付出口费用,从而在多个提供商之间实现灵活的GPU计算。
有报道指出西方公司正将AI工作负载迁移到中国模型,这正在演变为一个采购决策层面的趋势。
LiteParse 是一款快速的开源文档解析器,采用 Rust 编写,提供带边界框的高质量空间文本提取功能,支持多种语言和平台,适用于 AI 文档工作负载。
英特尔已停产的 Optane 持久内存技术在 AI 工作负载中找到了第二春,用户可以利用廉价的二手 Optane 模块,在本地以大约每秒 4 个 token 的速度运行一个 1 万亿参数的模型。文章强调了 Optane 相比 SSD 具有更低的延迟,使其尽管比 DRAM 慢,但依然适用于大型模型推理。
英特尔在Computex 2026上发布了Crescent Island GPU,最高配备480GB显存,基于Arc Xe 3P架构,面向下一代AI工作负载。
阿里巴巴发布了Zhenwu M890 AI芯片,该芯片专为满足AI智能体工作负载的内存和通信需求而设计,是其推动国产替代方案的一部分。
AMD认为,代理型AI需要重新思考基础设施规划,需要专用的CPU机架来处理编排和控制工作负载,将CPU:GPU比例从1:8或1:4转变为1:1或更高,而不是简单地给GPU密集型服务器增加更多CPU。