人工智能代理理解计算机架构吗?
摘要
本文介绍了AutoTuring,一个用于GPU加速器设计空间探索的AI代理,并通过比较硬件感知和不透明条件来评估架构知识是否提升性能。研究结果表明,意义有助于优化,但架构知识和结构化批评表现为替代品而非互补品。
arXiv:2609.19387v1 宣告类型:新
摘要:代理越来越多地被要求设计硬件,并且越来越多地报道成功。这类报告证实设计改进了;但不能解释为什么。一个改进加速器的代理可能在推理机器,或者可能在有效搜索其从未恢复意义的旋钮——只有前者能转移到下一个架构。现有评估无法区分两者,因为它们在保持问题框架固定的情况下改变代理。我们采取了相反的做法。AutoTuring将相同的代理两次交给相同的15维加速器空间:一次作为带有模拟器计数器的命名架构旋钮,一次作为[0,1]上的匿名变量,评估器、合法空间和可达最优保持一致,因此唯一变化的是问题是否有意义。两者之间的差距就是测量结果。在九个核心的FP16 GEMM篮子中,意义是有回报的:架构师平均比建模的H200高出5.4%,比其盲对等物高出12.3%,模拟器调用减少了70.1%。它并非唯一有回报:批评循环为盲代理恢复了大部分差距,而对架构师没有帮助,因此架构知识和结构化批评表现为替代品而非互补品。我们报告这些为初步发现——每个条件在单个建模加速器上运行五到六次——并将比较本身而非加速器视为贡献。
查看缓存全文
缓存时间: 2026/09/18 09:17
# AI智能体是否理解计算机体系结构?
来源:https://arxiv.org/html/2609.19387
Grigory Chirkov,Soheil Abbasloo
所属机构:微软研究院
###### 摘要
智能体越来越多地被要求设计硬件,并且其成功案例也越来越多。此类报告能证明设计效果有所提升,但无法解释其原因。改进加速器的智能体可能确实在推理机器特性,也可能只是熟练地调整其从未理解含义的参数旋钮——只有前一种能力才能迁移到下一种架构。现有评估无法区分这两种情况,因为它们在改变智能体的同时保持了问题框架固定。我们采取了相反的做法。
AutoTuring将相同的15维加速器空间交给同一个智能体两次:一次以带模拟器计数器的命名架构旋钮呈现,一次以[0,1]区间内的匿名变量呈现,且评估器、合法空间和可达最优解均保持不变。因此唯一变化的变量是问题是否具有含义。两者之间的差异即为测量结果。
在九个FP16 GEMM内核测试集中,含义带来了收益:架构师条件比建模的H200快5.4%,比盲搜索条件平均快12.3%,且模拟器调用次数减少70.1%。但这种优势并非独有:批评循环为盲搜索智能体恢复了大部分差距,却未给架构师带来收益,这表明架构知识与结构化批评是替代关系而非互补关系。我们暂将这些作为初步发现报告——每个条件在单一建模加速器上运行了五到六次——并将比较方法本身(而非加速器本身)视为本文的贡献。
## 1 引言
AI模型能力的快速提升使研究者得以将智能体自动化应用于越来越多的计算机科学领域,如编译器工程[7]、GPU编程[11]、操作系统[2]、网络[8]等。该领域自然也涌现出许多旨在利用AI自动化加速计算机芯片架构设计的项目[4,5,9,10,13]。但与此同时,这些项目都未能明确回答“AI模型和智能体是否真正理解计算机体系结构?”这一问题。有些研究将AI生成的架构与手工数学优化循环的结果进行比较[10],另一些论文则分析为智能体提供更多工具和特定指导如何改变其输出[9]。这两种方法都未能将通用智能体技能与特定架构知识区分开,也未能区分模型对架构的内在知识/理解与通用实验能力。
图1:AutoTuring概览。硬件感知与不透明条件对同一设计空间探索问题呈现不同视图,但共享相同的Actor-Critic循环和评估器。
本文试图弥补这一缺失。我们提出AutoTuring——一个用于AI GPU加速器配置设计空间探索的智能体:给定初始设计、硅面积预算和目标工作负载,它返回在预算内性能最佳的配置(图1)。候选配置通过内部GPU架构模拟器(高度修改的LLMCompass衍生品[12])进行评分。智能体并非将其视为纯黑盒估计器:模拟统计量作为一级输入进入其上下文,Actor分析输出计数器以提出新候选方案。Actor和Critic以辩证方式推进[1]:独立的Critic智能体持有自己的上下文,质询Actor的提案并论证修正建议。最终Actor接受或拒绝修正,使用新配置启动模拟并重复此过程。
使其成为测量工具而非普通调优器的关键在于:它剥离了架构含义却不改变问题本质。相同的空间被交给同一个Actor两次:一次以带模拟器计数器的命名架构旋钮呈现(“架构师”条件),另一次以匿名变量x₀,...,x₁₄∈[0,1]呈现(“优化器”条件)。评估器、合法空间和可达最优解完全相同,因此唯一变化的变量是“含义”,这使得标题问题获得了操作化定义:*如果剥离含义后智能体结果不变,则它从未使用架构知识——只是在进行搜索。* 两个条件之间的差异即为测量值。
我们使用AutoTuring回答两个问题:
1. **能力**:在目标工作负载更窄的条件下,自主智能体能否从A100[3]输入配置出发,达到比H200[6]更好的最终设计?
2. **理解**:架构知识是否能使智能体获得比盲黑盒搜索更优的优化结果?
能力问题很快得到解决:仅靠搜索,架构师就达到了比参考设计快5.4%、平均比优化器条件好12.3%的设计,且模拟器调用次数减少70.1%。理解问题则未解决,且其未能解决的过程本身正是我们的发现。含义的优势仅在智能体缺乏其他结构化搜索手段时才存在:Critic为优化器条件恢复了大部分差距,却未给架构师带来任何收益,使两者差距缩小到0.8%以内。知识与辩证批评似乎成为替代品——两者都是指向“下一步搜索方向”这一稀缺资源的途径,而在广阔的近优平台上,一条途径就足够了。
我们视这些为初步结果,并正研究更困难的问题和更大空间以验证其持续性。相关工作及其与本研究的差异在附录A中评述。
## 2 方法论
AutoTuring沿两个正交轴评估设计空间探索:单智能体与Actor-Critic搜索、硬件感知与不透明问题表示。所有条件在相同物理约束下搜索相同的15维GPU加速器空间。可调参数包括SM数量、Tensor Core吞吐量、MMA平铺维度、L1/L2/L3容量与带宽、缓存深度及缓存域组织结构;HBM带宽和工艺节点固定。完整范围见附录B.2。
候选配置在九个FP16 GEMM内核上评估,覆盖带宽受限、中强度、计算受限场景,包括解码式GEMV、瘦投影和吞吐量主导型GEMM。工作负载集合见附录B.5。目标是受面积和岸线约束限制的GPU时间加权遗憾值。
**智能体设置**:在单智能体条件下,Actor维护可执行的Python优化器,提出候选架构,观察评估结果并更新搜索策略。Actor-Critic条件在每个Actor回合后添加无状态Critic,审查搜索历史并推荐探索或优化方向。Critic无工具且无法提交设计。所有运行使用相同的Actor、评估器、工具、12轮时限和每轮300次评估限制。Actor和Critic智能体均使用相同的基础模型(Anthropic claude-opus-4.8快照),采用贪心解码调用。以下报告的所有四个条件均使用附录B.7定义的v1提示生成,单智能体变体使用完全相同的提示但添加`--no-critic`参数。因此比较不受提示生成、模型选择或工具访问的影响。
在硬件感知条件下,Actor看到架构参数名称和特定硬件反馈。在不透明条件下,相同空间以归一化变量x₀,...,x₁₄∈[0,1]呈现,反馈提供完全相同的每工作负载模拟器计数器和约束值,但所有领域语义被剥离(报告为无信息的分量索引c₀,...,c₈和通用约束限制)。不透明变量和反馈在智能体可见接口之外映射到原生硬件配置,确保可达设计空间、评估器和遥测数据丰富度严格相同。因此两个条件仅在*含义*上不同,而非信息内容。更多实现细节见附录B.1。
**参考底盘**:候选配置需符合建模A100在4N工艺下的物理包络,并额外满足约束片外接口(如HBM PHY)的A100岸线限制;面积和余量见附录B.3。所有候选的HBM带宽固定为4800 GB/s(基于原版A100的2048 GB/s,按4N节点基线缩放至4.8 TB/s),因此搜索无法通过片外带宽提升性能。
**评估设置**:所有设计均使用我们修改的LLMCompass模型[12]评估,该模型估计映射、芯片面积、芯片周长和内核延迟。对于每个候选架构,LLMCompass在有效映射下返回每个工作负载的最佳建模延迟。我们使用这些延迟计算GPU时间加权遗憾值:
$$R(d) = \frac{\sum_i w_i \ell_i(d) / \ell_i^{\text{ref}}}{\sum_i w_i}$$
其中$\ell_i(d)$是设计$d$在内核$i$上的建模延迟,$\ell_i^{\text{ref}}$是冻结的参考延迟,$w_i$是运行时权重。值越低越好。我们报告每次运行的最佳可行设计,并通过相同流程评估建模A100和H200参考值;内部映射优化见附录B.4。
## 3 结果
表1比较了九内核测试集中硬件感知与不透明设置下的单智能体和Actor-Critic系统与H200的结果,包括建模基线。平均最佳值是每次运行最佳总延迟的平均值,评估次数/运行是每次运行的平均模拟器调用次数。每次运行的评估次数反映各智能体自身的搜索策略,而非框架施加的预算,因此以下效率差异是观察性的;未来工作将平衡各条件的该预算。
表1:九内核测试集结果。- b750.1出现两次并非笔误;两个数值四舍五入后相同。以2×2矩阵阅读时,该表讲述的是一个故事而非四个。
架构框架在智能体单独搜索时带来收益:硬件感知单智能体实现12.3%更低的平均最佳延迟,评估次数减少70.1%。批评在框架被隐藏时带来收益:Critic使优化器条件的平均最佳延迟提高4.7%,评估次数减少22.2%。两者共同作用收益甚微:配备Critic的两个条件的最佳设计差距在0.8%以内,而Critic使架构师的平均最佳延迟增加了3.4%。
因此,架构知识与结构化批评似乎提供了部分可替代的搜索结构:两者都提供了“下一步搜索方向”的假设。图2解释了Critic在硬件感知设置中收益有限的原因:不同运行在不同的近优区域达到相似强度的设计,因此一旦Actor找到良好区域,额外指导提供的空间有限。由于每个条件仅运行五到六次,这些发现具有启发性而非结论性。
**搜索行为**:延迟差异显示*架构师条件搜索效果更好*;只有日志能显示它是否*进行架构层面的搜索*。轨迹日志记录Actor每轮的推理过程,因此我们可以分析它是在论证还是仅在爬坡。以下三个片段具有代表性;所有引文均直接取自一次硬件感知运行,选择标准是可读性而非结果;相同模式在所有六次运行中重现。
它首先按瓶颈划分测试集并相应分配预算:“*目标同时受限于带宽受限尾部(gemv_decode)和计算受限尾部(compute_square)。因此我从两方面分配面积。*”最大的单项改进(0.464→0.410)来自通过阅读成本模型将某旋钮重新归类为免费项:“*面积在所有平铺形状下都保持698.02不变,因为面积由tc_macs_per_cycle驱动,而非M/N/K几何结构。因此扩大MMA平铺实质上不消耗面积*”,并基于延迟恒等式而非抽样来证明该操作。
更有信息量的是其错误的假设。第5轮它认为缓存容量宽松,将L1/L2削减至下限以换取SM;第6轮开始即撤回:“*缓存是承重结构而非宽松项(v5论题被证伪)。将L1/L2削减至下限导致巨型内核延迟上升:gemv_decode从416增至455。*”第二个假设——大容量L3可将HBM重取转化为命中——在五轮后在控制条件下重新测试,因为智能体注意到首次测试存在混淆因素——随后被证伪。智能体还推翻了Critic的建议,因其阅读过评估器源码:“*Critic建议提高hbm_bw。hbm_bw并非旋钮。space.apply_design从固定常量设置HBM带宽,并显式忽略任何提供的值。*”
赋予相同空间但剥离含义后,优化器条件未产出任何类似内容;其轮次读起来纯粹是坐标空间记账:“*第11轮复制收敛:最佳平均配置为x₁₂=0.25, x₆=0.108, x₁₄=0.5, x₁₁=0.10(得分0.3933–0.3949,最小0.39336,约束683.7——余量适中)。x₆=0.121/x₁₄=0.45组在无收益情况下消耗更多约束;x₁₁=0.048略差。我们处于噪声平台(σ≈0.0015–0.003);配置间差距在噪声范围内。c₀/c₃在多轮冻结轴扫描中确认不可约。*”
这种对比为论文提供了最清晰的定性证据,表明硬件框架用于推理物理特性而非仅作展示。
## 4 讨论与未来工作
为何含义与批评可以互换?一种可能解释是当前优化问题并未复杂到需要专门的架构推理,或者辩证循环提供了足够的结构化假设生成来替代领域知识。这提示我们:在特定约束条件下,优化智能体的能力边界可能比预期更接近通用搜索,而真正的架构理解需要更复杂的评估体系或更具挑战性的设计空间来显现。相似文章
AI代理是否让构建软件比理解软件更容易?
一位开发者反思了AI编码代理如何能够快速构建和修改软件,但开发者往往失去对代码库架构和决策的理解,从而带来新的工程挑战。
代理式神经架构发现:AIRA-Compose与AIRA-Design
本文介绍了AIRA-Compose和AIRA-Design,这两个双重框架利用AI智能体自主发现超越标准Transformer且高效扩展的神经架构。
开发AI代理硬件。我们搞错了什么?
一位开发AI代理硬件的开发者反思了专用硬件是否比现有的云端和本地解决方案更有优势,并邀请批判性反馈,以避免制造出错误的产品。
分享一种面向AI代理的不同研究架构,用以检查并解决运行自主代理时的已知瓶颈。欢迎反馈?
介绍了一种面向AI代理的新研究架构,其核心是一个透明运行时,每次交互都会成为可重放的执行轨迹,具有完全可检查性,包括规划、执行、观察、验证和记忆阶段。
自主芯片设计中的智能体协调
本文探讨了使用大语言模型和AI智能体进行自主芯片设计,将其建模为AI组织,并讨论了芯片设计场景中黑盒优化的动作空间。