标签
本文提出FIBER,一种新型的GPU执行模型,通过解耦线程-寄存器所有权,实现动态并行和细粒度调度,在AI工作负载(如LLMs)的张量计算中取得显著性能提升。
MiCoPro 提出了一种用于混合精度量化的端到端软硬件协同设计框架,利用硬件感知代理模型在延迟约束下搜索最优的逐层位宽,并直接部署到边缘硬件,在准确率下降不到3%的情况下,实现了最高40%的延迟降低。
提出了RED-PIM,一种算法-架构协同设计,将内存体间的数据移动从O(N²)降低到O(N),并缩小注意力矩阵,使Transformer模型的推理时间显著降低(16%到99.99%)。
本文提出了一种面向N:M稀疏视觉Transformer推理的软硬件协同设计框架,通过一种新颖的CUDA内核(MD-SpMM)和部署感知的稀疏性搜索,在保持准确性的同时,在GPU上实现了超过2.2倍的延迟加速。
NVIDIA 推出了一系列关于 AI 模型协同设计的文章,从模型维度如何影响 GPU 性能开始,作者称这涵盖了推理优化基础知识的80/20。
本综述全面回顾了面向绿色AI的资源高效架构与软硬件协同设计,涵盖高效模型构建、训练/部署策略以及可持续硬件,旨在指导大模型的可持续发展。
这条推文讨论了由于硬件限制,ML研究如何收敛于基于注意力、优化矩阵乘法(matmul)的算法,借鉴了‘硬件彩票’概念,并指出OpenAI的9个月芯片流片是硬件-研究协同设计的潜在迹象。
本文提出DxPTA,一种新颖的设计空间探索方法,用于高效地对满足面积、功耗、能量和延迟约束的光子Transformer加速器进行硬件/软件协同设计。与穷举方法相比,其搜索速度最高提升15.2倍,从而能够为多种Transformer模型实现高效的PTA设计。
本文提出了一种模型原生计算架构,通过计算机架构的视角展望未来系统设计。
作者指出,'意念转文本'是一个前景广阔的领域,目前正受到众多团队的探索,并强调软硬件协同设计对于成功实现这一技术至关重要。