@bingxu_: 两个月前我创办了INT21,今天我很自豪地宣布我们走出隐身模式,推出第一款产品……
摘要
INT21 宣布推出 PTX Kernel Factory,这是一个自我改进的智能体集群,能够自主大规模生成专家级 PTX GPU 内核,并提供开源概念验证实现和 beta 访问权限。
查看缓存全文
缓存时间: 2026/06/17 03:47
我两个月前创办了 INT21,今天很自豪地宣布,我们带着第一款产品走出隐身模式:PTX Kernel Factory。我们打造了首个自我改进的智能体集群,能够自主且大规模地生成专家级的 PTX 内核。 https://int21.ai
INT21 | 自我改进的计算基础设施
来源:https://int21.ai/
用计算改进计算。
INT21 为现代 AI 底层的软件构建自我改进的 AI 系统。我们的第一款产品生成并优化底层 GPU 软件,然后通过测试和基准来验证其工作。
INT21用计算改进计算INT21用计算改进计算 PTX Kernel Factory首次公开发布2026年6月16日公司成立
介绍 INT21 和 PTX Kernel Factory (https://int21.ai/insights/introducing-int21-and-ptx-kernel-factory/)
我们正在为现代 AI 底层的软件构建自我改进的 AI 系统。PTX Kernel Factory 的前四次实现已开源,该产品现已进入测试阶段。
01 / 首次验证
由 PTX Factory 生成。与最佳基线对比。
PTX Kernel Factory 在 Hopper 和 Blackwell 上生成了四个 GPU 内核产物。我们使用匹配的硬件和输入,对照成熟的专家级实现进行了测试,并在计时前验证了正确性。
GH200 / Hopper 1.59x
实测峰值性能。
B200 / Blackwell 1.52x
优化集成。
GH200 / Hopper 8.17%
几何平均更快。
B200 / Blackwell 126 / 126
每个可比案例都更快。
这是算子级基准测试结果,而非全模型加速声称。
自主优化循环证据跨代保留PTX Kernel Factory自主改进循环自主智能体集群生成 GPU 内核,在目标硬件上评估,保留证据,并将该知识输入下一代。规划编写审查调优智能体集群自主目标 GPU实时01编译02正确性03基准最佳有效候选+18.7%代际Gen 01Gen 08Gen N+1搜索记忆保留的证据启动下一代PTX Kernel Factory自主改进循环智能体集群生成内核,目标硬件评估,保留的证据改进下一代。自主集群规划编写审查调优智能体集群目标 GPU实时编译正确基准最佳有效候选+18.7%保留的证据Gen 01Gen 08Gen N+1证据累积到下一代
- 01### 完全自主的集群 专门化的智能体端到端地规划、实现、审查和优化每个内核。
- 02### 基于真实硬件 每个候选都会在目标 GPU 上编译、验证和基准测试。
- 03### 改进不断累积 可重用的证据既改进了搜索过程,也改进了其生成的内核。
云原生集群控制平面实时系统模型1. 01 / 弹性扩展 数千个智能体 云原生调度围绕可用计算资源扩展集群。 2. 02 / 统一方向 一个可衡量的目标 每个智能体都遵循相同的约束和验收标准。 3. 03 / 代际记忆 经验向前传递 结果、失败和策略成为下一代智能体的起点。
- 01智能体
- 02模型
- 03GPU
- 04基础设施
- 05云
AI 原生运营模式
工程能力随计算扩展,而非随人员增长。
我们的专家设定方向、约束和验收标准。自主智能体集群执行、评估并保留工作成果,因此增加计算资源就能扩展 INT21 能够执行的工程工作量。
创始人 / 跨栈运营者
将研究、系统和基础设施经验集于一家公司。
Bing Xu,INT21 创始人兼首席执行官### Bing Xu
创始人兼首席执行官
- 智能体
- 模型
- GPU
Bing 是原始生成对抗网络(GAN)论文的合著者,创建了 XGBoost 的 Python 包,并共同创建了 MXNet 和 AITemplate。在创立 INT21 之前,他是 NVIDIA 的杰出工程师,此前 NVIDIA 收购了他创办的 GPU 推理公司 HippoML。
Qingye Jiang,INT21 创始合伙人### Qingye Jiang
创始合伙人
- 基础设施
- 云
Qingye 在 AWS 从事高性能计算和分布式系统的构建与调优超过十年。他的工作涵盖工作负载分析、性能工程、云基础设施和实时系统。
PTX Kernel Factory / 测试版
给我们一个高难度的 GPU 工作负载。
从一个速度太慢的运算开始,或者一个缺乏成熟内核的新架构,又或者一个尚未值得投入数周专家时间的重要工作负载。
申请测试版访问 (https://forms.gle/XPHW2xTKbTNhbfKe9)
相似文章
@songhan_mit: 我们开发了一种基于智能体的原生方法来加速生成式AI,延续了KDA(内核设计智能体)在更高层次上的成功…
Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。
@dogacel0: 在初始发布4个月后,"auto-gpu-kernel" 版本 1.0 终于发布!这是一个完全自主的内核生成…
Auto-GPU-Kernel 版本 1.0 已发布,这是一个自主的 GPU 内核生成和优化工具,在 MLSys 2026 FlashInfer AI Kernel Generation Contest 中排名第一,平均加速比为 34.93 倍。
@HongyiJin258:AI 智能体正在成为 GPU 内核工程师。我们正在围绕它们重新思考编译器栈。认识一下 TIRx Harness:一个开……
MLC AI 发布 TIRx Harness,这是一个开源编译器框架,为 AI 智能体提供一个结构化环境,用于探索、调试和优化 GPU 内核。由智能体构建的 Kimi Delta Attention 内核,在前向传播上相比 FlashKDA 实现了 2.94 倍的几何平均加速,在反向传播上相比 FLA 实现了 6.84 倍的加速。
@QuixiAI: https://x.com/QuixiAI/status/2073936537213915611
QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。
@ycombinator:General Instinct (@gen_instinct) 将前沿AI模型部署到受限边缘硬件上,助力机器人技术和物理…
General Instinct 推出一个部署层,使前沿AI模型能够在如 Jetson 和移动 NPU 等受限边缘硬件上运行,帮助机器人技术和物理AI团队实现低延迟离线推理。