标签
Google Cloud 和 RadixArk 合作,将开源推理框架 SGLang 引入 Google Cloud TPU,初期通过 SGL-JAX,后续推出 SGL-torchtpu 提供原生 PyTorch 支持,让开发者能够无缝在 GPU 和 TPU 上运行生产工作负载。
一款名为XProf Cubism Reducer的开源工具可将JAX/XLA的TensorBoard跟踪大小减少90%以上,使性能分析更加高效。
JAXBench是一个新的基准测试套件,包含50个JAX工作负载,用于评估在谷歌云TPU上的AI生成内核优化,提供人工调优基线和智能体评估框架。论文发现,基于精选TPU文档进行条件化处理能显著提升正确性和加速比,其中Autocomp波束搜索在人工调优内核上相比XLA实现了高达1.6倍的几何平均加速。
谷歌宣布其训练后优化库 Tunix 迎来重大更新,推出了异步解耦式回滚引擎,用于在 JAX/TPU 上规模化实施基于智能体的强化学习,消除空闲时间,提升吞吐量。
一个关于形式化教科书的实验,用 TypeScript 和 Jax 实现了《经典力学的结构与解释》第一章,包含代码与数学对齐以及模拟器。
Google Cloud 详细介绍了他们如何在 Ironwood TPU 上使用模块化、模型无关的工程手册优化 Qwen 3.5-397B MoE,实现了 3.1 倍的解码性能和 4.7 倍的预填充性能提升。
谷歌推出了 TPU 开发者中心,这是一个集中式资源,包含在 Google Cloud TPU 上构建、训练和提供 AI 服务的文档和框架指南,支持 JAX、PyTorch 和 vLLM。
这篇博客文章探讨了一种技术,利用LFortran、Enzyme和Tesseract使传统的Fortran模拟代码变得可微分,从而实现自动微分并与JAX集成,以用于机器学习流程。
本文档介绍了 hijax 类型,这是 JAX 的一项新功能,允许定义具有自身不变量、切线类型、批处理和分片行为的自定义类型,并通过量化数组的示例进行说明。
这篇博士论文提供了一本关于可微光线追踪用于无线电传播建模的自包含教材,将自动微分(例如JAX)集成到光线追踪流程中,以解决逆问题并训练机器学习模型,用于下一代无线设计。
SOLAR是一个框架,它利用LLM前端和确定性分析,从PyTorch和JAX源代码自动推导经过验证的光速性能界限,从而为深度学习工作负载提供余量分析和优化洞察。
使用基于 JAX 的流水线和 Vision Transformer,通过自对弈强化学习训练了一个超人类水平的 Generals.io 智能体。在人类 1v1 排行榜上排名第一;所有代码和一个快速的 JAX 模拟器均已开源。
本文详细解释了JAX的核心思想,包括函数纯度、不可变性、显式状态管理和JIT编译,帮助读者从面向对象思维转向函数式编程以优化机器学习性能。
一篇关于文本到图像生成的论文已发布,附有开源代码、模型和完整的训练方案,并与其他模型的性能进行了比较。
MiniT2I 是一个极简的直接RGB文本到图像生成器,使用像素空间MM-JiT去噪器,结合流匹配和冻结的FLAN-T5-Large文本令牌,并开源了JAX/Flax和PyTorch实现以及检查点。
本文提出了acopula,一个JAX原生的嵌套阿基米德Copula推断框架,能够处理任意删失、嵌套树,并利用泰勒模式自动微分计算精确参数梯度,相比现有方法实现了显著的加速。
一名用户演示了使用OpenAI的Codex自动生成一个Colab笔记本,该笔记本在JAX/Flax/Optax中训练一个约1000万参数的transformer进行加法运算,在T4 GPU上经过4000步后达到了高准确率。
本文介绍了Mahjax,一个完全向量化的立直麻将模拟器,基于JAX实现,用于GPU加速的强化学习,具有高吞吐量,并支持从零开始训练。
NVIDIA 与 Google Cloud 在 Google I/O 上宣布了针对双方联合开发者社区的新学习路径、Codelabs 和直播活动,旨在帮助 AI 构建者利用 JAX、NVIDIA Dynamo 和 Gemma 4 等工具,在 Google Cloud 上使用 NVIDIA AI 平台。
jax-js的进展包括新的matmul基准测试、更快的实时TTS演示、改进的代码生成,以及运行Gemma 3 270B的LLM演示。jax-js是一个开源Web ML框架。