kernel-optimization

标签

Cards List
#kernel-optimization

在40核 M5 Max 上的 Splash:通过调优内核为你的芯片实现解码性能提升20%

Reddit r/LocalLLaMA ↗ · 5天前

本文介绍了如何在 Splash 中使用 'make tune-kernels' 工具来优化40核 M5 Max 芯片上的 AI 模型解码,通过为特定硬件调优内核布局,实现高达20%的速度提升。

0 人收藏 0 人点赞
#kernel-optimization

Show HN: 智能代理CUDA内核优化器

Hacker News Top ↗ · 5天前 缓存

一个智能代理CUDA内核优化器,通过迭代代码生成、正确性检查、基准测试和优化,自动化GPU实现生成,由LangGraph和OpenAI模型驱动。

0 人收藏 0 人点赞
#kernel-optimization

@RisingSayak: 发现更快的内核?您不应该需要重写模型来使用它。借助 Kernels,您可以选择哪个内核运行…

X AI KOLs Following ↗ · 2026-09-18 缓存

这个Twitter线程介绍了Hugging Face的Kernels,这是一个工具,允许用户选择和替换AI模型中支持层的优化内核实现,而无需重写整个模型。

0 人收藏 0 人点赞
#kernel-optimization

@no_stp_on_snek:DeepSeek-V4.1-Flash 运行于 2 张 Sparks 上。thinking 设为高,TP=2。处理了 55M tokens。这是实际的内核优化工作,并非演示。它阅读了笔记并…

X AI KOLs Timeline ↗ · 2026-09-15 缓存

本文描述了针对 DeepSeek-V4.1-Flash AI 模型在 Metal 硬件上的一项优化,改进了注意力内核,使其仅启动必要的 tile 块,从而减少了计算浪费并提升了推理速度。

0 人收藏 0 人点赞
#kernel-optimization

@reprompting: 今日阅读tritonBLAS文章 https://arxiv.org/pdf/2512.04226

X AI KOLs Timeline ↗ · 2026-09-14 缓存

本文介绍了tritonBLAS,这是一种分析模型,用于优化GPU GEMM内核参数,无需运行时自动调优,实现近最优性能并显著减少编译时间。

0 人收藏 0 人点赞
#kernel-optimization

AMDKernelVault:面向AMD GPU内核优化的大规模数据集与智能代理训练

arXiv cs.CL ↗ · 2026-09-14 缓存

本文介绍AMDKernelVault,这是一个用于AMD GPU内核优化的开放数据集和训练框架,包含大规模HIP和Triton内核,以及用于生成和验证内核的代理驱动流水线。

0 人收藏 0 人点赞
#kernel-optimization

Google Accelerator Agents for TPU Development (GitHub仓库)

TLDR AI ↗ · 2026-09-08 缓存

Google Accelerator Agents是一个GitHub仓库,包含AI驱动的工具,用于加速TPU上的机器学习开发,特色是使用Gemini的代理进行代码迁移和内核优化。

0 人收藏 0 人点赞
#kernel-optimization

DataKernelBench: LLMs能否优化GPU数据库查询?

arXiv cs.CL ↗ · 2026-08-27 缓存

本文介绍了DataKernelBench,这是一个用于评估LLMs在优化GPU内核以处理数据库查询方面的基准测试,相比如torch.compile等基线方法实现了加速。

0 人收藏 0 人点赞
#kernel-optimization

KernelArc:一个用于GPU内核优化的多智能体框架

arXiv cs.AI ↗ · 2026-08-19 缓存

KernelArc是一个多智能体框架,使用策略专业化智能体来自主优化GPU内核以处理异构工作负载,并在NVIDIA GPU基准测试中取得顶级排名。

0 人收藏 0 人点赞
#kernel-optimization

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

arXiv cs.LG ↗ · 2026-08-14 缓存

This paper presents CAKE, a compiler-agent co-design framework that lets AI agents author a hardware-explicit IR for GPU kernels, achieving significant speedups over baselines across various workload families.

0 人收藏 0 人点赞
#kernel-optimization

Kernel Forge:一个基于LLM的CUDA内核生成与优化智能体框架

arXiv cs.AI ↗ · 2026-07-29 缓存

Kernel Forge是一个开源智能体框架,利用大语言模型和蒙特卡洛树搜索,为任何未经修改的PyTorch模型自动生成并优化CUDA内核,在Gemma 4 E2B的softmax上实现了高达2.83倍的加速。

0 人收藏 0 人点赞
#kernel-optimization

花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。

Reddit r/LocalLLaMA ↗ · 2026-07-24

作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。

0 人收藏 0 人点赞
#kernel-optimization

SonicSampler:用于LLM采样和推测性验证的统一Tile感知内核

arXiv cs.AI ↗ · 2026-07-24 缓存

SonicSampler 提出了一套统一的Tile感知Triton内核,垂直融合了整个LLM采样流水线,支持动态的逐请求行为和推测性验证,相较于最先进的基线实现了高达16倍的加速。

0 人收藏 0 人点赞
#kernel-optimization

JAXBench:对自主TPU内核优化进行基准测试

arXiv cs.AI ↗ · 2026-07-24 缓存

JAXBench是一个新的基准测试套件,包含50个JAX工作负载,用于评估在谷歌云TPU上的AI生成内核优化,提供人工调优基线和智能体评估框架。论文发现,基于精选TPU文档进行条件化处理能显著提升正确性和加速比,其中Autocomp波束搜索在人工调优内核上相比XLA实现了高达1.6倍的几何平均加速。

0 人收藏 0 人点赞
#kernel-optimization

@gpuwaster: GPU Grind 第61/100篇:正在学习这场GTC 2020讲座:开发CUDA内核将Tensor Core推向绝对极限…

X AI KOLs Timeline ↗ · 2026-07-11 缓存

作者在其共100部分的GPU学习系列中,回顾了Andrew Kerr在GTC 2020上的一场讲座,内容是关于开发高性能CUDA内核以将NVIDIA A100的Tensor Core性能推向极致,探讨了相关技术以及原生CUDA与CUTLASS之间的取舍。

0 人收藏 0 人点赞
#kernel-optimization

@realSharonZhou: 我们需要针对RSI的前沿模型强化学习能力提供更好的GPU性能基准测试,我有一些想法。…

X AI KOLs Timeline ↗ · 2026-07-05 缓存

Sharon Zhou提出了一个与厂商无关的内核级GPU性能基准测试,旨在帮助AI代理优化前沿模型的计算效率,并以AMD的AgentKernelArena为起点。

0 人收藏 0 人点赞
#kernel-optimization

@reach_vb: 我有大量个人副项目想用Sol处理:1. 优化llama.cpp中的MTP支持(寻找低垂果实…)

X AI KOLs Timeline ↗ · 2026-07-02 缓存

用户分享了使用Sol的计划:优化llama.cpp中的MTP支持、标准化聊天模板、恢复废弃的whisper项目、完成个人理财应用以及内核优化。

0 人收藏 0 人点赞
#kernel-optimization

@googlegemma:“代理内核优化是端侧推理的未来” @xenovacom 使用 Fable 5 编写内核,将……

X AI KOLs Timeline ↗ · 2026-07-01 缓存

Xenova 使用 Fable 5 编写优化内核,在 M4 上的 WebGPU 中为 Gemma 4 实现了每秒 255 个 token 的速度,展示了用于端侧推理的代理内核优化。

0 人收藏 0 人点赞
#kernel-optimization

@h100envy: Meta的PyTorch核心工程师将CUDA内核编写变成了一项13分钟的运动——比1500美元的GPU编程课程还要好……

X AI KOLs Timeline ↗ · 2026-06-30 缓存

Meta的一位PyTorch核心工程师展示了一个快速的CUDA内核优化循环,其性能优于昂贵的训练营,获胜代码通过KernelBot竞赛合并到了PyTorch中。

0 人收藏 0 人点赞
#kernel-optimization

Linux 7.2 改进匿名/未命名管道性能,提升Shell管道及其他

Lobsters Hottest ↗ · 2026-06-27 缓存

Linux 7.2 内核合并了一项针对匿名/未命名管道的性能优化,通过在互斥锁外部预分配页面来避免竞争,使吞吐量提升 6-48%,延迟降低 17-33%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈