标签
PyTorchCon北美2026大会设有内核工程轨道,专注于编译器、优化、自定义内核和系统工作,并有Mark Saroufim的主题演讲。
文章探讨了AI辅助如何简化了创建具有亚微秒级编译时间的快速JIT编译器的过程,并通过一个基于Rust的正则表达式引擎示例进行了演示。
Mojo 是一种专为AI加速器和GPU设计的编程语言,现已在Apache 2.0许可下完全开源,其编译器和工具链已在GitHub上提供,用于开发和贡献。
本文详细介绍了 Haskell 的 GHC 编译器在依值类型方面的最新进展,包括 GADTs 中的可见 forall、命名空间指定导入以及其他编译器改进。
一篇技术博客文章,解释如何计算图的支配点,比较 Lengauer-Tarjan 算法与“A Simple, Fast Dominance Algorithm”,并深入介绍数据流方法背后的直觉。
LWN的一条评论讨论了C语言编译器中尾调用优化相对较新的实现,引用了历史上的局限性,并指出现代的GCC和Clang现已支持该优化,这对解释器实现有潜在好处。
一篇博客文章探讨了 C89 标准中关于隐式函数声明的歧义,GCC 和 Clang 对此解释不一,导致某些代码产生不同的编译结果。
深入探讨 utfcpp 库中 UTF-8 解码的优化,揭示 Clang 和 GCC 为 ASCII 快速路径生成不同的汇编代码,从而导致显著的性能差异。
本文探讨了解析 C 语言 `sizeof` 运算符所面临的挑战,该运算符可以接受表达式或带括号的类型,而复合字面量和后缀运算符又带来了额外的复杂性。文章讨论了解析策略,并指出 C2y 新引入的 `_Countof` 运算符也面临类似问题。
这篇文章探讨了关于前 ANSI C(K&R C)的一些晦涩细节,包括 void 的缺失、不同的浮点类型以及简化的类型说明符规则。文章解释了该语言上下文相关语法是如何通过单遍编译器的限制来证明其合理性的。
Claude Fable 使用 pyptx DSL 为 NVIDIA B200 编写了一个 FlashAttention 前向内核,其性能与手动调优的 CUTLASS 内核接近,展示了 AI 代理在编译器和 DSL 设计中的潜力。
一本由 Douglas Thain 教授编写的免费在线教材,介绍编译器构造,读者可学习如何为类 C 语言构建编译器,生成 X86 或 ARM 汇编代码。支持免费下载或购买纸质版。
CS 6120 是一门博士级别的自助式在线高级编译器课程,涵盖中间表示、数据流、优化,并包括论文阅读和使用 LLVM 和 Bril 的实现任务。
本文讨论了编写可移植C代码的实际挑战,这些挑战源于对非标准编译器扩展和glibc条件头文件的依赖,并通过构建C编译器的示例进行说明。
本文讨论了部分静态单信息(SSI)形式,这是一种编译器中 SSA 的扩展,用于捕获依赖于路径的类型信息。文章提出了一种在动态语言中构建 SSA 期间实现部分 SSI 的实用捷径,具体引用了 Ruby 的 ZJIT 中的实现。