标签
本文讨论了AI中的开环/闭环问题,将GPU硬件从通用到专用ASIC的历史演变与AI模型的学习循环进行类比,对比了开环训练与大脑中发现的闭环学习。
KDA是一个由智能体驱动的内核设计框架,通过最小化人工参与,帮助HAN Lab在MLSys FlashInfer Kernel Contest中获得顶尖排名。该智能体利用Humanize、KernelWiki和性能分析技能来生成最先进的内核。
华盛顿大学SyFI团队在MLSys2026期间举办的FlashInfer AI内核生成竞赛中赢得了多个奖项,得到了NVIDIA和Modal的支持。
华盛顿大学SyFI实验室的成员在MLSys'26竞赛(NVIDIA赛道)中赢得了多个奖项,包括GDN赛道全智能体方法第一名、GDN赛道智能体辅助方法第二名、DSA赛道全智能体方法第三名。
Mark Saroufim在MLSys会议上发表了主题演讲,涵盖了AI系统的演变、为何需要AI来改进它们以及有前景的未来方向。录制视频即将发布。
BLASST 是一种无需训练的动态稀疏注意力机制,它利用在线 softmax 统计量上的单一标量阈值来跳过不重要的注意力块,在 MLSys26 上获得最佳论文奖。该机制在保持准确性的同时,实现了超过 70% 的稀疏度,预填充阶段加速 1.52 倍,解码阶段加速 1.48 倍。
ExecuTorch,PyTorch的设备端AI部署框架,在MLSysConf 2026上获得了最佳行业论文奖。该论文提出了一种统一的解决方案,可在从微控制器到SoC的各种硬件上运行模型。