标签
NVIDIA 报告了在 HSTU 推理测试中使用 PyTorch AOTI 后端的显著加速,在理想情况下最高可达 2.38 倍,并强调了用于大规模生成式推荐系统的工具如 recsys-examples 和 nv-embedding-cache。