@RisingSayak: 发布首个内核以最终优化来自@Lightricks的LTX-2.3!torch.compile + cuDNN attn 已经…
摘要
发布了一个自定义内核,进一步优化来自Lightricks的LTX-2.3,在GB10上实现了1.52倍加速,基于之前的torch.compile和cuDNN注意力优化。
查看缓存全文
缓存时间: 2026/06/13 14:27
发布了我的第一个内核,以完成优化 LTX-2.3(来自 @Lightricks)的最后冲刺!
torch.compile + cuDNN attn 已经带来了 1.42 倍的提升。加上自定义内核后,我在 GB10 上获得了 1.52 倍的提升 🔥
这是我系统探索简单代理内核开发工作流程的成果。
更多内容 👇 https://t.co/u4iDpzSir0
相似文章
多视角不平衡感知的6G波束成形优化与性能
本文对6G-IoT波束成形优化进行了系统的机器学习研究,比较了网络、环境、设备和视觉特征组的预测能力,并应用聚类方法以提升性能。
动量作为深度学习优化中残差驱动的乘子校正
本文介绍了一个受ADMM启发的动量框架(AIM)和一个新的优化器RADAR,从理论上将动量解释为残差驱动的乘子校正,实验表明在强自适应基线上取得了持续改进。
挑战下的训练:神经网络的可执行证书与挑战闭合最优性
介绍“Training Under Challenge”(挑战下训练),这是一个可执行证书框架,利用架构有效的过程构建替代模型,并估计神经网络检查点的经验全局最优性差距,具有理论保证以及基于 ResNet-18 蒸馏和量化去噪的实验。
预测随机低维重参数化何时能训练神经网络
本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。
$\varepsilon$-MemEvo:面向LLM程序演化的自适应跨任务记忆迁移
本文介绍了ε-MemEvo,一个用于基于LLM的程序演化中跨任务知识迁移的框架,它将策略记忆存储为自然语言摘要,并使用自适应注入门控。该框架在8个优化基准上均取得了性能提升,计算开销不到1%。