标签
本文解释了 CUDA 内核在 GPU 上如何工作,涵盖了 CUDA、GPU 架构、线程、块的基础知识,以及它们在人工智能和机器学习中的角色。
本文解释了GPU如何将计算工作组织为内核、网格、块和线程束,以实现大规模并行并通过流式多处理器隐藏内存延迟。
文章认为,人工智能的真正力量在于通过多智能体系统实现的大规模协作,例如OpenAI的群体架构迅速解决Navier-Stokes问题。
本文解释了如何使用 NVIDIA Warp 和 MjWarp 在 GPU 上扩展机器人模拟,实现并行环境以加速学习工作流。
Typesafe AI 创始人 Diego Almeida 介绍了 JEV,这是一个专为实时自动化优化的新型基础模型。文章探讨了其并行计算架构以及在游戏模拟和无人机导航等实际案例中的能力。
Bend是一种快速、并行的编程语言,通过证明机制防止AI出错,专为AI辅助开发而设计,拥有C语言级别的速度和CUDA并行能力。
Victor Taelin幽默地评论了与Bend编程语言用户相关的职位名称,如金属弯曲师和Vulkan弯曲师。
OpenAI 同时使用了约 10,000 个 AI 代理来解决 Navier-Stokes 方程,表明科学进步可能随着计算能力的提升而显著扩展。
本文详细介绍了使用16个RTX 5060 Ti GPU和PLX交换机运行Deepseek V4 Flash模型的已验证硬件配置,实现了特定的上下文处理和吞吐量性能指标。
KernelArc是一个多智能体框架,使用策略专业化智能体来自主优化GPU内核以处理异构工作负载,并在NVIDIA GPU基准测试中取得顶级排名。
Rex 是一个静态类型、纯函数式的工作流语言,专为科学计算和数据处理设计,支持并行执行、内容寻址存储和 Docker 隔离。
文章讨论了由于物理限制,CPU速度提升带来的免费性能增益的终结,并强调随着多核处理器的兴起,软件开发向并发性的根本性转变。
本文提出了一种并行架构,将静态梯度方法组合起来以实现随机梯度下降的自适应性,在简化收敛性分析的同时保留参数自适应性。
Y Combinator 举办了一场 Paper Club,研究人员展示了多 GPU 内核优化的创新,包括 ParallelKittens,这是一个简化重叠多 GPU 内核开发并在多种工作负载下实现显著加速的 CUDA 框架。
一篇对比五种AI硬件架构(CPU、GPU、TPU、NPU、LPU)的解说文章,附带可视化图表,涵盖了它们在灵活性、并行性和内存访问方面针对AI工作负载的权衡。
一篇更新的CUDA编程初学者友好教程,涵盖如何编写简单的内核在GPU上对数组进行加法运算。
本文详细介绍了当CUDA内核被编译并在NVIDIA GPU上执行时发生的情况,涵盖了编译为PTX和SASS的过程,以及底层硬件的交互。