gpu-kernels

标签

Cards List
#gpu-kernels

跨GPU内核的确定性LLM推理:二的幂次INT8量化缩放与基于容差一致性检查的局限性

arXiv cs.LG · 2026-09-02 缓存

本文评估了LLM推理中INT8量化的一致性测试套件,发现二的幂次量化缩放能够实现跨内核的位级确定性,而基于容差的检查仅限于预条件和有界性。

0 人收藏 0 人点赞
#gpu-kernels

AsmEvo: 带功能等价验证的AMD GPU内核智能汇编级优化

arXiv cs.CL · 2026-08-24 缓存

AsmEvo 是一个用于AMD GPU内核的智能汇编级优化器,通过提出低级编辑并验证与原始二进制文件的功能等价性来提高性能,在MI308X GPU上实现了高达3.88倍的加速。

0 人收藏 0 人点赞
#gpu-kernels

整数不在场证明:定位INT8量化LLM推理中的跨核发散

arXiv cs.LG · 2026-08-17 缓存

本文测试了CUTLASS和Triton INT8量化GPU内核在LLM推理中使用vLLM的可互换性,发现由于尺度应用和舍入导致输出发散,并提出了一种内核等效的一致性程序。

0 人收藏 0 人点赞
#gpu-kernels

用于LLM生成GPU内核的契约级验证器,以及门控线性递归族的原生Blackwell反向训练内核

arXiv cs.LG · 2026-08-14 缓存

本文介绍了一种契约级验证器,包含十二个对抗性门,用于检查LLM生成的GPU内核,发现标准宽松测试接受的内核中有39.5%是损坏的。本文还提出了门控线性递归(GDN)家族的首个原生Blackwell训练反向内核。

0 人收藏 0 人点赞
#gpu-kernels

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

arXiv cs.LG · 2026-08-14 缓存

This paper presents CAKE, a compiler-agent co-design framework that lets AI agents author a hardware-explicit IR for GPU kernels, achieving significant speedups over baselines across various workload families.

0 人收藏 0 人点赞
#gpu-kernels

CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本

arXiv cs.LG · 2026-08-10 缓存

CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。

0 人收藏 0 人点赞
#gpu-kernels

无攻击者的博弈:选择压力下LLM驱动搜索中的基准指纹识别

Hugging Face Daily Papers · 2026-08-09 缓存

本文研究了LLM驱动的GPU内核进化优化如何对评估配置进行指纹识别,导致30%的分布内获胜结果在留出设置上失败。本文提供了失败模式的分类体系,以及战略优化下稳健基准测试的设计指南。

0 人收藏 0 人点赞
#gpu-kernels

告别抽象

Hacker News Top · 2026-08-06 缓存

Hazy Research 认为,AI 智能体能够直接从模糊的提示中生成针对目标优化的内核代码,这使 CUDA DSL 逐渐过时,意味着抽象可能面临淘汰。

0 人收藏 0 人点赞
#gpu-kernels

@vikhyatk: 厌倦了手动调优GPU内核,所以我们构建了一个编译器。Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成……

X AI KOLs Timeline · 2026-08-03 缓存

Photon 2.0 是一个新的推理引擎和编译器,可将 Moondream、Qwen 3.5 和 Gemma 4 等模型编译为巨型内核,声称在物理AI工作负载上比 vLLM 和 SGLang 的吞吐量高达 2.3 倍。

0 人收藏 0 人点赞
#gpu-kernels

MSLK kernel reference (Website)

TLDR AI · 2026-08-03 缓存

Documentation reference for MSLK 1.3.0, a library of fused GPU kernels for transformer workloads including attention, quantization, GEMM, and MoE routing, supporting CUDA and ROCm with PyTorch integration.

0 人收藏 0 人点赞
#gpu-kernels

并行编程的禅意:内核的姿态

Hacker News Top · 2026-07-22 缓存

一篇博客文章,通过HipKittens论文的视角探索并行编程概念,重点介绍了AMD GPU上重叠计算与内存移动的八波乒乓调度,并与禅宗原则进行了哲学类比。

0 人收藏 0 人点赞
#gpu-kernels

@PyTorch:PyTorch-Triton 3.7 发布版引入了 Triton Plugin Extensions 系统,这是一个用于动态加载自定义…的框架

X AI KOLs Following · 2026-07-15 缓存

PyTorch-Triton 3.7 发布版引入了 Triton Plugin Extensions 系统,支持动态加载自定义编译器传递和 DSL 扩展至上游 Triton,无需分叉,并且现可开箱即用支持 Meta 的 TLX。

0 人收藏 0 人点赞
#gpu-kernels

面向B300的全新FP4注意力内核,速度相比FA4提升最高达1.69倍

Reddit r/LocalLLaMA · 2026-07-14 缓存

FastVideo团队发布了面向B300的全新FP4注意力内核,速度相比FlashAttention 4提升最高达1.69倍。

0 人收藏 0 人点赞
#gpu-kernels

@shiposcant: 完成阅读这篇:"你越了解某件事,就越能更好地提示LLM,因为你可以将未知的未知..."

X AI KOLs Timeline · 2026-07-09 缓存

一篇博客文章描述了使用Codex自动迭代和优化GPU内核,相较于基线实现了212倍加速。文章强调了专业知识如何放大AI的效用,通过循环实验工作流将未知的未知转化为已知的未知。

0 人收藏 0 人点赞
#gpu-kernels

@dejavucoder: 我最新的一篇博客文章 "auto-research with codex: 我如何在使用Codex的GPU Mode中实现比基线快212倍的内核…"

X AI KOLs Timeline · 2026-07-08 缓存

Sankalp的博客文章,详细描述了他如何使用Codex在GPU Mode的竞赛中为QR分解实现快232倍的GPU内核,并概述了他的自动研究方法论。

0 人收藏 0 人点赞
#gpu-kernels

@ekzhang1:我看着像这个家伙一样写真正的GPU内核的人 :)

X AI KOLs Timeline · 2026-07-08 缓存

AI模型Claude被用于使用pyptx DSL编写FlashAttention前向内核,在NVIDIA B200硬件上实现了与手工调优的FlashAttention-4近乎相同的性能。

0 人收藏 0 人点赞
#gpu-kernels

@elliotarledge:Claude Fable 5 [max] 在 KernelBench-Hard 上的表现。给我印象最深的核心是 B200 fp8 GEMM:它手动编写了原始的 SM10…

X AI KOLs Timeline · 2026-07-03 缓存

Claude Fable 5 通过为 B200 fp8 GEMM 手动编写 PTX 代码,在 KernelBench-Hard 上取得了顶级结果,超越了其他模型,并在计算密集型形状上达到峰值性能的 44-59%。

0 人收藏 0 人点赞
#gpu-kernels

@bingxu_: 两个月前我创办了INT21,今天我很自豪地宣布我们走出隐身模式,推出第一款产品……

X AI KOLs Timeline · 2026-06-16 缓存

INT21 宣布推出 PTX Kernel Factory,这是一个自我改进的智能体集群,能够自主大规模生成专家级 PTX GPU 内核,并提供开源概念验证实现和 beta 访问权限。

0 人收藏 0 人点赞
#gpu-kernels

@no_stp_on_snek: 我的第二个且迟交的 Build Small 参赛作品。10天,1位开发者:从头构建的 Rust 引擎 + 自定义 GPU 内核 vs vLLM 在 N…

X AI KOLs Following · 2026-06-15 缓存

一位开发者从头构建了一个 Rust 推理引擎,带有自定义 GPU 内核,在 Nemotron-30B 解码上优于 vLLM,达到 75.7 vs 57 tok/s,提交至 Build Small 黑客马拉松。

0 人收藏 0 人点赞
#gpu-kernels

MiniMax Sparse Attention:百万令牌上下文(GitHub 仓库)

TLDR AI · 2026-06-15 缓存

MiniMaxAI 发布了 MSA,这是一个面向 NVIDIA SM100 GPU 优化的密集和稀疏注意力内核库,能够通过 FlashAttention 和稀疏 top-k 注意力高效处理百万令牌上下文。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈