@bingxu_: 两个月前我创办了INT21,今天我很自豪地宣布我们走出隐身模式,推出第一款产品……

X AI KOLs Timeline 产品

摘要

INT21 宣布推出 PTX Kernel Factory,这是一个自我改进的智能体集群,能够自主大规模生成专家级 PTX GPU 内核,并提供开源概念验证实现和 beta 访问权限。

两个月前我创办了INT21,今天我很自豪地宣布我们走出隐身模式,推出第一款产品:PTX Kernel Factory。我们创建了首个自我改进的智能体集群,能够自主大规模生产专家级 PTX 内核。 https://int21.ai
查看原文
查看缓存全文

缓存时间: 2026/06/17 03:47

我两个月前创办了 INT21,今天很自豪地宣布,我们带着第一款产品走出隐身模式:PTX Kernel Factory。我们打造了首个自我改进的智能体集群,能够自主且大规模地生成专家级的 PTX 内核。 https://int21.ai


INT21 | 自我改进的计算基础设施

来源:https://int21.ai/

用计算改进计算。

INT21 为现代 AI 底层的软件构建自我改进的 AI 系统。我们的第一款产品生成并优化底层 GPU 软件,然后通过测试和基准来验证其工作。

INT21用计算改进计算INT21用计算改进计算 PTX Kernel Factory首次公开发布2026年6月16日公司成立

介绍 INT21 和 PTX Kernel Factory (https://int21.ai/insights/introducing-int21-and-ptx-kernel-factory/)

我们正在为现代 AI 底层的软件构建自我改进的 AI 系统。PTX Kernel Factory 的前四次实现已开源,该产品现已进入测试阶段。

01 / 首次验证

由 PTX Factory 生成。与最佳基线对比。

PTX Kernel Factory 在 Hopper 和 Blackwell 上生成了四个 GPU 内核产物。我们使用匹配的硬件和输入,对照成熟的专家级实现进行了测试,并在计时前验证了正确性。

GH200 / Hopper 1.59x

实测峰值性能。

B200 / Blackwell 1.52x

优化集成。

GH200 / Hopper 8.17%

几何平均更快。

B200 / Blackwell 126 / 126

每个可比案例都更快。

这是算子级基准测试结果,而非全模型加速声称。

自主优化循环证据跨代保留PTX Kernel Factory自主改进循环自主智能体集群生成 GPU 内核,在目标硬件上评估,保留证据,并将该知识输入下一代。规划编写审查调优智能体集群自主目标 GPU实时01编译02正确性03基准最佳有效候选+18.7%代际Gen 01Gen 08Gen N+1搜索记忆保留的证据启动下一代PTX Kernel Factory自主改进循环智能体集群生成内核,目标硬件评估,保留的证据改进下一代。自主集群规划编写审查调优智能体集群目标 GPU实时编译正确基准最佳有效候选+18.7%保留的证据Gen 01Gen 08Gen N+1证据累积到下一代

  1. 01### 完全自主的集群 专门化的智能体端到端地规划、实现、审查和优化每个内核。
  2. 02### 基于真实硬件 每个候选都会在目标 GPU 上编译、验证和基准测试。
  3. 03### 改进不断累积 可重用的证据既改进了搜索过程,也改进了其生成的内核。

云原生集群控制平面实时系统模型1. 01 / 弹性扩展 数千个智能体 云原生调度围绕可用计算资源扩展集群。 2. 02 / 统一方向 一个可衡量的目标 每个智能体都遵循相同的约束和验收标准。 3. 03 / 代际记忆 经验向前传递 结果、失败和策略成为下一代智能体的起点。

  1. 01智能体
  2. 02模型
  3. 03GPU
  4. 04基础设施
  5. 05云

AI 原生运营模式

工程能力随计算扩展,而非随人员增长。

我们的专家设定方向、约束和验收标准。自主智能体集群执行、评估并保留工作成果,因此增加计算资源就能扩展 INT21 能够执行的工程工作量。

创始人 / 跨栈运营者

将研究、系统和基础设施经验集于一家公司。

Bing Xu,INT21 创始人兼首席执行官### Bing Xu

创始人兼首席执行官

  • 智能体
  • 模型
  • GPU

Bing 是原始生成对抗网络(GAN)论文的合著者,创建了 XGBoost 的 Python 包,并共同创建了 MXNet 和 AITemplate。在创立 INT21 之前,他是 NVIDIA 的杰出工程师,此前 NVIDIA 收购了他创办的 GPU 推理公司 HippoML。

Qingye Jiang,INT21 创始合伙人### Qingye Jiang

创始合伙人

  • 基础设施
  • 云

Qingye 在 AWS 从事高性能计算和分布式系统的构建与调优超过十年。他的工作涵盖工作负载分析、性能工程、云基础设施和实时系统。

PTX Kernel Factory / 测试版

给我们一个高难度的 GPU 工作负载。

从一个速度太慢的运算开始,或者一个缺乏成熟内核的新架构,又或者一个尚未值得投入数周专家时间的重要工作负载。

申请测试版访问 (https://forms.gle/XPHW2xTKbTNhbfKe9)

相似文章

@songhan_mit: 我们开发了一种基于智能体的原生方法来加速生成式AI,延续了KDA(内核设计智能体)在更高层次上的成功…

X AI KOLs Following

Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。

@HongyiJin258:AI 智能体正在成为 GPU 内核工程师。我们正在围绕它们重新思考编译器栈。认识一下 TIRx Harness:一个开……

X AI KOLs Timeline

MLC AI 发布 TIRx Harness,这是一个开源编译器框架,为 AI 智能体提供一个结构化环境,用于探索、调试和优化 GPU 内核。由智能体构建的 Kimi Delta Attention 内核,在前向传播上相比 FlashKDA 实现了 2.94 倍的几何平均加速,在反向传播上相比 FLA 实现了 6.84 倍的加速。

@QuixiAI: https://x.com/QuixiAI/status/2073936537213915611

X AI KOLs Following

QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。