gpu-kernel

标签

Cards List
#gpu-kernel

@TheAhmadOsman: 又一项Kimi K3达到SoTA并超越前沿的事情

X AI KOLs Following · 2026-08-03 缓存

Kimi K3在新的pmpp-hard基准测试中取得了最先进的结果,在69个GPU内核任务中得分为0.71,并超越了其他前沿模型。

0 人收藏 0 人点赞
#gpu-kernel

@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…

X AI KOLs · 2026-07-29 缓存

OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。

0 人收藏 0 人点赞
#gpu-kernel

Fable 5 位居 KernelBench 榜首。Jack Clark 称其为“RSI 循环的起点”

Reddit r/singularity · 2026-07-06

Fable 通过编写高效 CUDA 超内核(megakernel),实现 18.71 倍加速,登上 KernelBench-Mega 榜首,标志着 AI 研发向递归自我改进迈出一步。

0 人收藏 0 人点赞
#gpu-kernel

EGG:专家引导的内核生成智能体框架

arXiv cs.AI · 2026-06-26 缓存

EGG 是一个专家引导的智能体框架,它将 GPU 内核生成分解为算法结构设计和硬件特定调优两个阶段,并采用阶段感知的多智能体协作机制。在 KernelBench 和实际工作负载上,EGG 相比 PyTorch 实现平均 2.13 倍的加速。

0 人收藏 0 人点赞
#gpu-kernel

@shreyansh_26: https://x.com/shreyansh_26/status/2069125463860302212

X AI KOLs Timeline · 2026-06-22 缓存

本文介绍了Decompose-K技术,用于加速瘦高大K矩阵乘法,通过将K维度分割成块,执行批量矩阵乘法,并求和部分结果。还提供了PyTorch实现和基准测试,显示对于形状不佳的矩阵乘法,相比标准torch.compile有显著加速。

0 人收藏 0 人点赞
#gpu-kernel

@ChengleiSi:兴奋地分享我们在内部自动研究系统 @Recursive_SI 上取得的初步结果,我们在……上达到了SOTA

X AI KOLs Following · 2026-06-11 缓存

Recursive的自动AI研究系统通过在无需任务特定适配的情况下自动化研究循环,在NanoChat、NanoGPT Speedrun和GPU内核基准测试上达到了最先进的成果,并开源了相关工件以供进一步检验。

0 人收藏 0 人点赞
#gpu-kernel

@charles_irl: ^这是CuTe DSL的一个示例,它用于FlashAttention-4内核等。以下是CuTe示例内核…

X AI KOLs Following · 2026-05-26

一条推文展示了一个CuTe DSL内核示例,该示例使用布局来表达转置,是FlashAttention-4内核的一部分。

0 人收藏 0 人点赞
#gpu-kernel

@PyTorch: PyTorch 成员 Meta 刚刚开源了一个 GPU 内核,使注意力在 NVIDIA Blackwell 上加速 2.3 倍。TLX Block Atte…

X AI KOLs Following · 2026-05-26 缓存

Meta 开源了 TLX Block Attention,这是一个 warp 特化的 Triton 内核,在 NVIDIA Blackwell GPU 上为块对角自注意力实现了 2.3 倍的加速,与旋转嵌入融合时加速可达 3.5 倍。

0 人收藏 0 人点赞
#gpu-kernel

最后,衷心感谢这个了不起的团队:@jcz42, Arjun, Driss, @tensorcore, @yoonrkim 和 @tri_dao!PDF: https://a…

X AI KOLs Following · 2026-05-21 缓存

CODA 引入了一种 GPU 内核抽象,将 transformer 计算重写为 GEMM-plus-epilogue 程序,减少内存受限操作,提高训练效率。

0 人收藏 0 人点赞
#gpu-kernel

Moonshot 开源 FlashKDA:面向 Kimi Delta Attention 的 CUTLASS 内核,H20 上最高比 Triton 基线快 2.22 倍

Reddit r/LocalLLaMA · 2026-04-22

MoonshotAI 发布 FlashKDA,开源 CUTLASS 内核实现 Kimi Delta Attention,在 H20 GPU 上相较 Triton 最高提速 2.22 倍。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈