标签
本文提出了一种面向N:M稀疏视觉Transformer推理的软硬件协同设计框架,通过一种新颖的CUDA内核(MD-SpMM)和部署感知的稀疏性搜索,在保持准确性的同时,在GPU上实现了超过2.2倍的延迟加速。
NVIDIA 推出了一系列关于 AI 模型协同设计的文章,从模型维度如何影响 GPU 性能开始,作者称这涵盖了推理优化基础知识的80/20。
本综述全面回顾了面向绿色AI的资源高效架构与软硬件协同设计,涵盖高效模型构建、训练/部署策略以及可持续硬件,旨在指导大模型的可持续发展。
这条推文讨论了由于硬件限制,ML研究如何收敛于基于注意力、优化矩阵乘法(matmul)的算法,借鉴了‘硬件彩票’概念,并指出OpenAI的9个月芯片流片是硬件-研究协同设计的潜在迹象。
本文提出DxPTA,一种新颖的设计空间探索方法,用于高效地对满足面积、功耗、能量和延迟约束的光子Transformer加速器进行硬件/软件协同设计。与穷举方法相比,其搜索速度最高提升15.2倍,从而能够为多种Transformer模型实现高效的PTA设计。
本文提出了一种模型原生计算架构,通过计算机架构的视角展望未来系统设计。
作者指出,'意念转文本'是一个前景广阔的领域,目前正受到众多团队的探索,并强调软硬件协同设计对于成功实现这一技术至关重要。