我构建了一个开源工具,可将JAX/XLA的TensorBoard跟踪大小减少90%以上(XProf Cubism Reducer)
摘要
一款名为XProf Cubism Reducer的开源工具可将JAX/XLA的TensorBoard跟踪大小减少90%以上,使性能分析更加高效。
暂无内容
相似文章
JAXBench:对自主TPU内核优化进行基准测试
JAXBench是一个新的基准测试套件,包含50个JAX工作负载,用于评估在谷歌云TPU上的AI生成内核优化,提供人工调优基线和智能体评估框架。论文发现,基于精选TPU文档进行条件化处理能显著提升正确性和加速比,其中Autocomp波束搜索在人工调优内核上相比XLA实现了高达1.6倍的几何平均加速。
@ariG23498: 制作了一个简单的工具来分享你的 GPU 性能分析追踪。 `uvx trace-tuil <本地追踪文件> -b <hf bucket name>`
一个使用命令行工具分享 GPU 性能分析追踪的简单实用工具,专为从事 GPU 性能分析的开发者设计。
@ekzhang1:本周末jax-js取得了一些进展! - 新的matmul基准测试 - 实时TTS演示(http://jax-js.com/tts) 快得多…
jax-js的进展包括新的matmul基准测试、更快的实时TTS演示、改进的代码生成,以及运行Gemma 3 270B的LLM演示。jax-js是一个开源Web ML框架。
@xenovacom: Bonsai 27B 彻底改变了本地 LLM 的游戏规则。1位量化将其从 54GB 缩小到仅 3.8GB(减少 93%),同时……
Bonsai 27B 通过 1 位量化实现了 93% 的体积缩减,同时保留了 90% 的智能,借助自定义 WebGPU 内核实现本地浏览器推理。
@tom_doerr: 将 Claude Code 和 Cursor 的 token 成本降低 60-95% https://github.com/yvgude/lean-ctx
lean-ctx 是一个基于 Rust 的开源上下文运行时,通过文件读取压缩和 Shell 输出优化,将 Claude Code、Cursor、Copilot 等 AI 编程助手的 token 成本降低 60–95%。它以 Shell Hook 和 MCP Server 的形式运行,提供 56 个工具及多种读取模式。