kernel-optimization

标签

Cards List
#kernel-optimization

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

arXiv cs.LG · 昨天 缓存

This paper presents CAKE, a compiler-agent co-design framework that lets AI agents author a hardware-explicit IR for GPU kernels, achieving significant speedups over baselines across various workload families.

0 人收藏 0 人点赞
#kernel-optimization

Kernel Forge:一个基于LLM的CUDA内核生成与优化智能体框架

arXiv cs.AI · 2026-07-29 缓存

Kernel Forge是一个开源智能体框架,利用大语言模型和蒙特卡洛树搜索,为任何未经修改的PyTorch模型自动生成并优化CUDA内核,在Gemma 4 E2B的softmax上实现了高达2.83倍的加速。

0 人收藏 0 人点赞
#kernel-optimization

花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。

Reddit r/LocalLLaMA · 2026-07-24

作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。

0 人收藏 0 人点赞
#kernel-optimization

SonicSampler:用于LLM采样和推测性验证的统一Tile感知内核

arXiv cs.AI · 2026-07-24 缓存

SonicSampler 提出了一套统一的Tile感知Triton内核,垂直融合了整个LLM采样流水线,支持动态的逐请求行为和推测性验证,相较于最先进的基线实现了高达16倍的加速。

0 人收藏 0 人点赞
#kernel-optimization

JAXBench:对自主TPU内核优化进行基准测试

arXiv cs.AI · 2026-07-24 缓存

JAXBench是一个新的基准测试套件,包含50个JAX工作负载,用于评估在谷歌云TPU上的AI生成内核优化,提供人工调优基线和智能体评估框架。论文发现,基于精选TPU文档进行条件化处理能显著提升正确性和加速比,其中Autocomp波束搜索在人工调优内核上相比XLA实现了高达1.6倍的几何平均加速。

0 人收藏 0 人点赞
#kernel-optimization

@gpuwaster: GPU Grind 第61/100篇:正在学习这场GTC 2020讲座:开发CUDA内核将Tensor Core推向绝对极限…

X AI KOLs Timeline · 2026-07-11 缓存

作者在其共100部分的GPU学习系列中,回顾了Andrew Kerr在GTC 2020上的一场讲座,内容是关于开发高性能CUDA内核以将NVIDIA A100的Tensor Core性能推向极致,探讨了相关技术以及原生CUDA与CUTLASS之间的取舍。

0 人收藏 0 人点赞
#kernel-optimization

@realSharonZhou: 我们需要针对RSI的前沿模型强化学习能力提供更好的GPU性能基准测试,我有一些想法。…

X AI KOLs Timeline · 2026-07-05 缓存

Sharon Zhou提出了一个与厂商无关的内核级GPU性能基准测试,旨在帮助AI代理优化前沿模型的计算效率,并以AMD的AgentKernelArena为起点。

0 人收藏 0 人点赞
#kernel-optimization

@reach_vb: 我有大量个人副项目想用Sol处理:1. 优化llama.cpp中的MTP支持(寻找低垂果实…)

X AI KOLs Timeline · 2026-07-02 缓存

用户分享了使用Sol的计划:优化llama.cpp中的MTP支持、标准化聊天模板、恢复废弃的whisper项目、完成个人理财应用以及内核优化。

0 人收藏 0 人点赞
#kernel-optimization

@googlegemma:“代理内核优化是端侧推理的未来” @xenovacom 使用 Fable 5 编写内核,将……

X AI KOLs Timeline · 2026-07-01 缓存

Xenova 使用 Fable 5 编写优化内核,在 M4 上的 WebGPU 中为 Gemma 4 实现了每秒 255 个 token 的速度,展示了用于端侧推理的代理内核优化。

0 人收藏 0 人点赞
#kernel-optimization

@h100envy: Meta的PyTorch核心工程师将CUDA内核编写变成了一项13分钟的运动——比1500美元的GPU编程课程还要好……

X AI KOLs Timeline · 2026-06-30 缓存

Meta的一位PyTorch核心工程师展示了一个快速的CUDA内核优化循环,其性能优于昂贵的训练营,获胜代码通过KernelBot竞赛合并到了PyTorch中。

0 人收藏 0 人点赞
#kernel-optimization

Linux 7.2 改进匿名/未命名管道性能,提升Shell管道及其他

Lobsters Hottest · 2026-06-27 缓存

Linux 7.2 内核合并了一项针对匿名/未命名管道的性能优化,通过在互斥锁外部预分配页面来避免竞争,使吞吐量提升 6-48%,延迟降低 17-33%。

0 人收藏 0 人点赞
#kernel-optimization

@bingxu_: 两个月前我创办了INT21,今天我很自豪地宣布我们走出隐身模式,推出第一款产品……

X AI KOLs Timeline · 2026-06-16 缓存

INT21 宣布推出 PTX Kernel Factory,这是一个自我改进的智能体集群,能够自主大规模生成专家级 PTX GPU 内核,并提供开源概念验证实现和 beta 访问权限。

0 人收藏 0 人点赞
#kernel-optimization

@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…

X AI KOLs Timeline · 2026-06-15 缓存

一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。

0 人收藏 0 人点赞
#kernel-optimization

@charles_irl: 给不关心FA4在softmax与MMA负载上分配多少warpgroup的人的tl;dr。推理与训练不…

X AI KOLs Following · 2026-06-11 缓存

解释推理内核与训练不同,Flash Attention 4 侧重于改变跨KV的并行性并支持小型不规则负载。

0 人收藏 0 人点赞
#kernel-optimization

@charles_irl: 去年秋天,我们分享了关于FA4内部机制的深度分析。但我们并未止步于理解内核。自那时起,我们一直在…

X AI KOLs Following · 2026-06-11 缓存

一篇博客文章详细介绍了对FlashAttention-4的贡献,通过调整并行策略和支持不规则内存访问,以提升其在大型语言模型推理中的性能,特别是针对解码密集型工作负载。

0 人收藏 0 人点赞
#kernel-optimization

@_akhaliq: GPU Forecasters 语言模型作为内核运行时优化的选择性代理

X AI KOLs Following · 2026-06-02 缓存

本文提出使用语言模型作为选择性代理来优化GPU内核运行时,展示了一种新颖的性能预测方法。

0 人收藏 0 人点赞
#kernel-optimization

阿里Qwen3.7-Max在陌生硬件上自主运行35小时,持续自我优化

Reddit r/ArtificialInteligence · 2026-05-25 缓存

阿里Qwen3.7-Max模型在陌生T-Head PPU硬件上,无需人工引导,自主优化生产内核长达35小时,进行1158次工具调用,实现10倍速度提升,展示了持续的自主智能体行为。

0 人收藏 0 人点赞
#kernel-optimization

@ickma2311: 高效AI讲座13:LLM部署技术 该讲座帮助我很好地理解了AWQ、vLLM和FlashAttention…

X AI KOLs Timeline · 2026-05-13 缓存

一场关于LLM部署技术的讲座,涵盖AWQ、vLLM、FlashAttention、量化和激活平滑,以实现高效服务。

0 人收藏 0 人点赞
#kernel-optimization

Metal-Sci:用于 Apple Silicon 上 LLM 驱动演化内核搜索的科学计算基准

Hugging Face Daily Papers · 2026-05-10 缓存

Metal-Sci 推出了一项包含 10 个任务的基准测试,用于优化 Apple Silicon 上的科学计算内核,并配套了由大语言模型驱动的演化搜索框架。该研究评估了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 等模型,在实现显著加速的同时,利用分布外测试来捕获静默的性能退化问题。

0 人收藏 0 人点赞
#kernel-optimization

@xenovacom:Opus 4.7 刚写了一个定制 WebGPU 内核,用融合 LinearAttention 算子把 Qwen3.5 推理速度提升最高 13 倍!智能内核…

X AI KOLs Following · 2026-04-23 缓存

Opus 4.7 自动生成定制 WebGPU 内核,通过融合 LinearAttention 将 Qwen3.5 推理加速最高 13 倍,现已随 Transformers.js v4.2.0 发布。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈