@ariG23498: 制作了一个简单的工具来分享你的 GPU 性能分析追踪。 `uvx trace-tuil <本地追踪文件> -b <hf bucket name>`
摘要
一个使用命令行工具分享 GPU 性能分析追踪的简单实用工具,专为从事 GPU 性能分析的开发者设计。
制作了一个简单的工具来分享你的 GPU 性能分析追踪。
`uvx trace-tuil <本地追踪文件> -b <hf bucket name>` https://t.co/tLYc2JegJW
查看缓存全文
缓存时间: 2026/05/15 23:09
制作了一个简单的工具来分享你的 GPU 配置文件跟踪。
uvx trace-tuil <local traces> -b <hf bucket name> https://t.co/tLYc2JegJW
相似文章
我构建了一个开源工具,可将JAX/XLA的TensorBoard跟踪大小减少90%以上(XProf Cubism Reducer)
一款名为XProf Cubism Reducer的开源工具可将JAX/XLA的TensorBoard跟踪大小减少90%以上,使性能分析更加高效。
花了3天在搭载40GB显存笔记本+TB4外置显卡的独特组合上,对llama.cpp的各类标志参数进行基准测试。最终实现:生成速度提升70%、预填充速度提升40%、上下文容量增加6万token,并向llama项目提交了关于MTP的技术问题报告。以下是实践中的关键发现。
作者在配备RTX 4090笔记本显卡和AMD XTX 7900外置显卡的混合GPU环境中对llama.cpp运行参数进行了基准测试,实现了生成速度提升70%、预填充速度提升40%,并在多GPU配置中发现了一个与MTP相关的错误。
janestreet/magic-trace
magic-trace是一款高分辨率追踪工具,使用Intel处理器追踪技术,以低开销捕获Linux进程的完整控制流快照,适用于调试和性能分析。
@sudoingX: 保存这条。它回答了一个每个24GB GPU用户都会问但几乎没人答对的问题:我实际能运行多大的上下文?
一位用户分享了在24GB GPU上运行Qwen 3.6 27b的详细VRAM用量测量数据,展示了上下文窗口大小和余量,并指出二手RTX 3090的性能与新卡完全相同。
@leopardracer: https://x.com/leopardracer/status/2055341758523883631
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。