profiling

标签

Cards List
#profiling

Goroutine 泄漏分析

Lobsters Hottest · 4天前 缓存

Go 1.27 引入了 goroutine 泄漏分析器,以准确检测和防止运行中的程序(包括生产系统)中的 goroutine 泄漏,且误报率极低。

0 人收藏 0 人点赞
#profiling

为什么 Arrays.fill 在 G1GC 上慢了 265 倍?

Hacker News Top · 5天前 缓存

本文探讨了为什么 Arrays.fill 在 G1GC 上比在 ParallelGC 上慢了 265 倍,通过详细的性能分析和汇编代码分析,将问题追溯到 JIT 生成的代码和内存屏障。

0 人收藏 0 人点赞
#profiling

Aiki Alpha 3 发布 - 性能提升

Lobsters Hottest · 2026-08-30 缓存

Aiki Alpha 3 发布,带来显著的性能改进,包括更低成本的运行时实现、自适应数表示、增强的性能分析和覆盖率,以及更严格的库约束。

0 人收藏 0 人点赞
#profiling

FleetSieve:面向SLO感知LLM舰队配置的决策关键型分析方法

arXiv cs.LG · 2026-08-21 缓存

FleetSieve提出了一种针对SLO感知LLM舰队配置的决策关键型分析方法,通过精简测量来优化资源分配,实现了相比均匀分析更高的效率。

0 人收藏 0 人点赞
#profiling

科学领域的软件理解确实参差不齐

Lobsters Hottest · 2026-08-07 缓存

一位软件工程师反思科学家往往缺乏软件工程技能,以优化天体物理学模拟后处理工具为例,倡导为科学家开设一门类似“Missing Semester”的课程。

0 人收藏 0 人点赞
#profiling

我构建了一个开源工具,可将JAX/XLA的TensorBoard跟踪大小减少90%以上(XProf Cubism Reducer)

Reddit r/LocalLLaMA · 2026-07-30

一款名为XProf Cubism Reducer的开源工具可将JAX/XLA的TensorBoard跟踪大小减少90%以上,使性能分析更加高效。

0 人收藏 0 人点赞
#profiling

如何对eBPF代码进行性能分析?

Hacker News Top · 2026-07-28 缓存

本文演示了如何通过创建一个简单的C测试框架来衡量文件打开延迟,从而对eBPF代码性能进行分析,使开发者能够比较附加eBPF钩子前后的开销。

0 人收藏 0 人点赞
#profiling

@ariG23498: 有两篇官方PyTorch教程链接到了"Profiling in PyTorch"系列!https://docs.pytorch.org/tutoria…

X AI KOLs Timeline · 2026-07-20 缓存

强调了两篇官方PyTorch教程,它们链接到了'Profiling in PyTorch'系列,提供了使用PyTorch性能分析器API进行性能调试的指导。

0 人收藏 0 人点赞
#profiling

CodeSizer:为什么那个二进制文件这么大?

Lobsters Hottest · 2026-07-19 缓存

CodeSizer 是一款用于嵌入式固件的静态代码大小分析工具,它利用 objdump 和 addr2line 将代码大小归因于内联调用树,并生成 HTML 报告。

0 人收藏 0 人点赞
#profiling

@ariG23498: 这个人真会写!将这种理解与性能分析(我系列的无耻推广)结合,你就无敌了! http://hf.…

X AI KOLs Timeline · 2026-07-15 缓存

一份面向初学者的指南,介绍如何使用 PyTorch 中的 torch.profiler 对深度学习工作负载进行性能分析和优化,涵盖追踪读取、CUDA 分析和 torch.compile 集成。

0 人收藏 0 人点赞
#profiling

PyTorch 性能分析 (第3部分):注意力即剖析

Hugging Face Blog · 2026-07-10 缓存

本教程演示了如何使用 PyTorch 性能分析器在 NVIDIA A100 GPU 上对各种注意力实现进行性能分析,从朴素注意力到具有不同后端的缩放点积注意力。

0 人收藏 0 人点赞
#profiling

深入理解Go运行时:性能分析

Hacker News Top · 2026-07-08 缓存

深入探讨Go的性能分析机制,解释运行时如何收集CPU、堆、阻塞、互斥锁和协程的性能分析数据,以及这些数据在pprof格式中的表示方式。

0 人收藏 0 人点赞
#profiling

智能体辅助的SGLang开发(18分钟阅读)

TLDR AI · 2026-07-03 缓存

本文探讨了智能体工具如何用于编码SGLang的开发工作流,将调试、基准测试和性能分析转化为可执行的技能和可复现的实验,像KDA-Pilot这样的努力已经产生了合并的PR。

0 人收藏 0 人点赞
#profiling

通过伦理困境对LLM进行亚里士多德美德分析

arXiv cs.AI · 2026-06-30 缓存

论文介绍了VirtueMap,这是一个通过亚里士多德美德伦理视角评估伦理困境回答排名来剖析大语言模型的框架,使用了经过验证的常识性真实数据。

0 人收藏 0 人点赞
#profiling

使用FPChecker的编译器辅助浮点错误分析与性能分析

Hacker News Top · 2026-06-29 缓存

ISC High Performance 2026上的半日教程,关于使用编译器辅助工具(FPChecker/LLVM)进行C/C++科学代码的浮点错误分析与性能分析。

0 人收藏 0 人点赞
#profiling

像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代

arXiv cs.LG · 2026-06-26 缓存

KernelPro是一个闭环多智能体系统,利用LLM和微剖析工具自动优化GPU内核代码,在KernelBench上实现了2.42×/4.69×/5.30×的几何平均加速,并在相同速度下实测能耗降低11.6%。

0 人收藏 0 人点赞
#profiling

SocialPersona:基于多模态社交媒体上下文的个性化画像与对话基准

arXiv cs.CL · 2026-06-26 缓存

介绍了SocialPersona,一个评估多模态大语言模型从纵向社交媒体时间线中恢复显性偏好并将其用于个性化对话能力的基准。

0 人收藏 0 人点赞
#profiling

人人都说AI需要更多GPU。我分析了一个GPU,发现它大部分时间都在闲置,只是在等待数据。所谓"GPU短缺"中,有多少实际上是GPU被浪费了?

Reddit r/artificial · 2026-06-18

分析表明,用于AI训练的GPU经常处于闲置等待数据的状态,这让人质疑GPU短缺问题的严重性。

0 人收藏 0 人点赞
#profiling

@ariG23498: 当我第一次从@cHHillee的博客文章“Making Deep Learning Go Brrrr From …”中听说内核融合时,我着迷了。

X AI KOLs Timeline · 2026-06-16 缓存

作者分享了对内核融合的兴奋之情,并演示了使用HuggingFace的kernels项目对GeGLU FFN融合的Liger内核进行性能分析,指出这个分析结果非常漂亮。

0 人收藏 0 人点赞
#profiling

@ariG23498: 现在是性能分析时间!在第2部分中,我们涵盖:> 追踪线性层 > 讨论 mul + add 与 linear 的对比 > gemm epilogues (我最…

X AI KOLs Timeline · 2026-06-11 缓存

宣布性能分析教程的第2部分,涵盖线性层追踪、gemm epilogues、MLP追踪以及torch compile与Liger内核的对比,并附有完整内容的链接。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈