profiling

标签

Cards List
#profiling

@ariG23498: 有两篇官方PyTorch教程链接到了"Profiling in PyTorch"系列!https://docs.pytorch.org/tutoria…

X AI KOLs Timeline · 昨天 缓存

强调了两篇官方PyTorch教程,它们链接到了'Profiling in PyTorch'系列,提供了使用PyTorch性能分析器API进行性能调试的指导。

0 人收藏 0 人点赞
#profiling

CodeSizer:为什么那个二进制文件这么大?

Lobsters Hottest · 昨天 缓存

CodeSizer 是一款用于嵌入式固件的静态代码大小分析工具,它利用 objdump 和 addr2line 将代码大小归因于内联调用树,并生成 HTML 报告。

0 人收藏 0 人点赞
#profiling

@ariG23498: 这个人真会写!将这种理解与性能分析(我系列的无耻推广)结合,你就无敌了! http://hf.…

X AI KOLs Timeline · 6天前 缓存

一份面向初学者的指南,介绍如何使用 PyTorch 中的 torch.profiler 对深度学习工作负载进行性能分析和优化,涵盖追踪读取、CUDA 分析和 torch.compile 集成。

0 人收藏 0 人点赞
#profiling

PyTorch 性能分析 (第3部分):注意力即剖析

Hugging Face Blog · 2026-07-10 缓存

本教程演示了如何使用 PyTorch 性能分析器在 NVIDIA A100 GPU 上对各种注意力实现进行性能分析,从朴素注意力到具有不同后端的缩放点积注意力。

0 人收藏 0 人点赞
#profiling

深入理解Go运行时:性能分析

Hacker News Top · 2026-07-08 缓存

深入探讨Go的性能分析机制,解释运行时如何收集CPU、堆、阻塞、互斥锁和协程的性能分析数据,以及这些数据在pprof格式中的表示方式。

0 人收藏 0 人点赞
#profiling

智能体辅助的SGLang开发(18分钟阅读)

TLDR AI · 2026-07-03 缓存

本文探讨了智能体工具如何用于编码SGLang的开发工作流,将调试、基准测试和性能分析转化为可执行的技能和可复现的实验,像KDA-Pilot这样的努力已经产生了合并的PR。

0 人收藏 0 人点赞
#profiling

通过伦理困境对LLM进行亚里士多德美德分析

arXiv cs.AI · 2026-06-30 缓存

论文介绍了VirtueMap,这是一个通过亚里士多德美德伦理视角评估伦理困境回答排名来剖析大语言模型的框架,使用了经过验证的常识性真实数据。

0 人收藏 0 人点赞
#profiling

使用FPChecker的编译器辅助浮点错误分析与性能分析

Hacker News Top · 2026-06-29 缓存

ISC High Performance 2026上的半日教程,关于使用编译器辅助工具(FPChecker/LLVM)进行C/C++科学代码的浮点错误分析与性能分析。

0 人收藏 0 人点赞
#profiling

像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代

arXiv cs.LG · 2026-06-26 缓存

KernelPro是一个闭环多智能体系统,利用LLM和微剖析工具自动优化GPU内核代码,在KernelBench上实现了2.42×/4.69×/5.30×的几何平均加速,并在相同速度下实测能耗降低11.6%。

0 人收藏 0 人点赞
#profiling

SocialPersona:基于多模态社交媒体上下文的个性化画像与对话基准

arXiv cs.CL · 2026-06-26 缓存

介绍了SocialPersona,一个评估多模态大语言模型从纵向社交媒体时间线中恢复显性偏好并将其用于个性化对话能力的基准。

0 人收藏 0 人点赞
#profiling

人人都说AI需要更多GPU。我分析了一个GPU,发现它大部分时间都在闲置,只是在等待数据。所谓"GPU短缺"中,有多少实际上是GPU被浪费了?

Reddit r/artificial · 2026-06-18

分析表明,用于AI训练的GPU经常处于闲置等待数据的状态,这让人质疑GPU短缺问题的严重性。

0 人收藏 0 人点赞
#profiling

@ariG23498: 当我第一次从@cHHillee的博客文章“Making Deep Learning Go Brrrr From …”中听说内核融合时,我着迷了。

X AI KOLs Timeline · 2026-06-16 缓存

作者分享了对内核融合的兴奋之情,并演示了使用HuggingFace的kernels项目对GeGLU FFN融合的Liger内核进行性能分析,指出这个分析结果非常漂亮。

0 人收藏 0 人点赞
#profiling

@ariG23498: 现在是性能分析时间!在第2部分中,我们涵盖:> 追踪线性层 > 讨论 mul + add 与 linear 的对比 > gemm epilogues (我最…

X AI KOLs Timeline · 2026-06-11 缓存

宣布性能分析教程的第2部分,涵盖线性层追踪、gemm epilogues、MLP追踪以及torch compile与Liger内核的对比,并附有完整内容的链接。

0 人收藏 0 人点赞
#profiling

PyTorch 性能分析(第 2 部分):从 nn.Linear 到融合 MLP

Hugging Face Blog · 2026-06-11 缓存

本篇博文继续 PyTorch 性能分析系列内容,探讨 nn.Linear、MLP 块以及使用 Triton 内核的融合技术,以优化性能。

0 人收藏 0 人点赞
#profiling

谷歌正在构建一个生活方式画像引擎,而非“有益助手”

Reddit r/ArtificialInteligence · 2026-05-29

谷歌的AI策略被批评为一种基于监视的画像引擎,通过强制登录迫使使用者同意,从而规避GDPR。本文揭露了谷歌用AI生成的答案和个性化追踪取代传统搜索的计划,称其为包裹在AI炒作中的法律漏洞。

0 人收藏 0 人点赞
#profiling

人类心理测量问卷误判LLM行为特征

Hugging Face Daily Papers · 2026-05-29 缓存

本文发现,人类心理测量问卷无法可靠预测LLM在真实交互中的行为,并提出基于生成的分析方法作为更准确的替代方案。

0 人收藏 0 人点赞
#profiling

PyTorch 中的性能分析(第一部分):torch.profiler 初学者指南

Hugging Face Blog · 2026-05-29 缓存

这是一份初学者友好的指南,介绍如何使用 PyTorch 的 torch.profiler 对神经网络操作进行性能分析和优化,从矩阵乘法和偏置加法开始。它解释了如何读取分析器跟踪并理解 CPU/GPU 交互。

0 人收藏 0 人点赞
#profiling

@RisingSayak: 我意识到,无法分析的东西就无法优化。这就是为什么我在Diffusers中开始了一个小项目,来……

X AI KOLs Following · 2026-05-22 缓存

Sayak Paul 描述了一个使用 torch.compile 分析和优化 Diffusers 流水线的项目,并宣布由 Ari G. 教授的相关教程系列。

0 人收藏 0 人点赞
#profiling

使用图论加速后端(2019年)

Lobsters Hottest · 2026-05-21 缓存

Sensor Tower 工程团队利用图论分析和性能分析工具,识别出后端端点缓慢的瓶颈,通过优化 Protobuf 解码和编码步骤,实现了四倍的速度提升。

0 人收藏 0 人点赞
#profiling

@WEB3_furture: 全球最贵的金融团队都在 GitHub 上开源了什么? 普通人怎么了解量化?直接上手是最快的 Jane Street、Goldman Sachs、J.P. Morgan 等顶级量化与高频交易机构,都放出了代表性的金融/工程工具,帮助普通量化…

X AI KOLs Timeline · 2026-05-21 缓存

该推文介绍了Jane Street、Goldman Sachs和J.P. Morgan等顶级量化机构开源的三个金融/工程工具:magic-trace(高精度进程追踪)、gs-quant(衍生品定价与风险管理Python包)和Perspective(实时数据可视化工具),帮助量化爱好者免费获得机构级技术能力。

1 人收藏 1 人点赞
Next →
← 返回首页

提交意见反馈