标签
这篇论文对 NVIDIA Hopper GPU 架构进行了多层级微基准测试分析,评估了 L2 分区缓存、第四代张量核心(FP8)、DPX 指令、分布式共享内存(DSM)和张量内存加速器(TMA)等新特性的性能表现,结果显示 TMA 异步编程可实现 1.5 倍矩阵乘法加速,FP8 性能接近 FP16 的两倍,DPX 指令可加速生物信息学算法至少 4.75 倍。
NAND-16是一台使用277,248个NAND门构建的计算机,展示了从基本数字逻辑组件构建功能系统的过程。
本文介绍了AutoTuring,一个用于GPU加速器设计空间探索的AI代理,并通过比较硬件感知和不透明条件来评估架构知识是否提升性能。研究结果表明,意义有助于优化,但架构知识和结构化批评表现为替代品而非互补品。
PC Anatomy 是一个用于计算机硬件的开源交互式3D探索器,允许用户从机箱到GPU核心解剖和检查PC组件,附带详细解释。
本文基准测试了Intel、AMD和ARM处理器上次正规浮点数的性能,显示Intel处理器在使用次正规数时出现显著减速,而AMD和ARM则不受影响。
本文介绍了PDP-8小型计算机的架构及其在教授基本计算机概念中的应用,并包含一个复刻模型的赠品活动。
本文阐述了 CHERIoT 如何在无 MMU 的情况下提供稳健的隔离,重点介绍了其设计及其在安全计算系统中的优势。
本文解释了x86未定义指令'ud2'命名背后的历史和原因,追溯了其从非官方操作码到Intel官方实现的演变,这得益于Hyrum定律。
该推文推荐了Algorithmica的HPC系列中关于CPU缓存的部分,详细介绍了延迟、内存访问模式和理论延迟等概念,以帮助编写更快的软件。
本文提出了Gauntlet,一个使用LLM的多智能体流水线,用于对计算机架构论文进行深度技术理解,并表明在20次比较中,其分析结果有15次优于人工分析。
对图灵奖得主 David Patterson 的采访,涵盖 RISC 与 CISC 的历史、GPU/TPU 比较、摩尔定律及职业建议。
一份涵盖内存分段概念的速查表,可能对学生和开发者有用。
一项回顾性分析认为,8086分段内存架构是一个巧妙的设计,本可以优雅地扩展,但软件开发者坚持将内存视为平坦空间,导致了其被认为存在缺陷。
这篇博客文章主张在计算机体系结构中回归严谨的全系统时序仿真,以克服“时序仿真墙”并准确捕捉现代系统行为,提倡使用统计上可靠的方法测量正确的执行区间,而不是详细仿真一切。
文章介绍了《系统性能》书中关于延迟、吞吐量、缓存层级等核心概念,并引用了Jeff Dean等专家的延迟数字资源,强调动手实践对性能工程的重要性。
该讲座介绍了GPU架构作为SIMD(向量/数组)处理器的灵活演化,讨论了数据并行性、存储体分组、体冲突、串行瓶颈以及SIMD指令历史(如MMX),强调GPU如何利用数据并行性并应对串行瓶颈。