SwiftCTS:基于少样本校准的跨设计快速预测与时钟树指标帕累托优化

arXiv cs.LG 论文

摘要

SwiftCTS是一个物理信息代理框架,利用梯度提升集成和少样本校准,快速预测并帕累托优化未见设计上的时钟树指标(功耗、线长、时钟偏移),以极少的训练数据实现高精度。

arXiv:2606.11348v1 公告类型:新 摘要:时钟树综合(CTS)是物理设计流程中计算代价高昂的阶段,需要反复调用EDA工具,在庞大的配置空间中搜索最优的功耗、线长和时钟偏移。现有的机器学习方法需要对未见过的宏架构进行代价高昂的重新训练或微调,并且与穷举组合搜索所需的数百万次评估在架构上不匹配。我们提出SwiftCTS,一个同时解决这两个问题的物理信息代理框架。通过将轻量级、基于物理的统计特征与梯度提升集成相结合,SwiftCTS在CPU上训练时间不到五秒,无需GPU支持即可提供亚毫秒级推理。为了应对分布外(OOD)设计而无需重新训练或微调,我们引入了K-shot乘法校准机制,该机制仅需一两次物理参考运行即可锚定预测,将未见宏上的功耗预测误差从24.5%降至3.3%,线长误差从56.6%降至1%以下。将该引擎与进化优化器集成后,SwiftCTS在十秒内评估100,000个CTS配置,生成在OpenROAD流程中经过物理验证的帕累托最优前沿。闭环验证确认功耗和线长的预测误差低于0.5%,时钟偏移预测在OOD基准上在5皮秒以内,在所有目标指标上始终优于默认工具启发式方法。代码公开于:\href{https://anonymous.4open.science/r/SwiftCTS-7E6E}{https://github.com/BarsatKhadka/SwiftCTS}
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:46

# SwiftCTS:基于少样本校准的时钟树指标快速跨设计预测与帕累托优化
来源:https://arxiv.org/html/2606.11348

###### 摘要

时钟树综合(CTS)是物理设计流程中计算成本高昂的阶段,需要反复调用EDA工具以在庞大的配置空间中探索最优的功耗、线长和时序偏移。现有的机器学习方法需要对未见过的宏架构进行昂贵的重新训练或微调,且其架构与穷举组合搜索所需的数百万次评估不匹配。我们提出SwiftCTS,一种同时解决这两个局限性的物理信息代理框架。通过将轻量级、基于物理的统计特征与梯度提升集成相结合,SwiftCTS在CPU上训练时间不到五秒,且无需GPU支持即可实现亚毫秒级推理。为了处理分布外(OOD)设计而无需重新训练或微调,我们引入了一种K样本乘法校准机制,该机制仅通过一次或两次物理参考运行即可锚定预测,将未见过宏上的功耗预测误差从24.5%降低到3.3%,线长误差从56.6%降低到1%以下。将此引擎与进化优化器集成后,SwiftCTS在十秒内评估100,000个CTS配置,生成经OpenROAD流程物理验证的帕累托最优前沿。闭环验证确认,在OOD基准测试上,功耗和线长的预测误差低于0.5%,时序偏移预测在五皮秒以内,且在所有目标指标上始终优于默认工具启发式方法。代码公开可见于:https://anonymous.4open.science/r/SwiftCTS-7E6E

## I. 引言

时钟树综合仍然是现代物理设计流程中计算成本高昂的阶段。由于时钟分配网络显著影响整体芯片功耗、时序偏移和布线拥塞,工程师必须通过反复调用EDA工具,基于固定布局评估不同配置,以在庞大的配置空间中仔细探索并实现最优结果质量(QoR)。这种穷举试错式的工作流程造成了巨大的计算瓶颈,严重延长了物理设计周期。为了自动化此任务,研究人员提出了多种方法,包括基于规则的数据挖掘[9](https://arxiv.org/html/2606.11348#bib.bib3)、高维元建模[11](https://arxiv.org/html/2606.11348#bib.bib4)、[1](https://arxiv.org/html/2606.11348#bib.bib5)、神经网络[14](https://arxiv.org/html/2606.11348#bib.bib6)以及空间和生成式架构[19](https://arxiv.org/html/2606.11348#bib.bib7)[15](https://arxiv.org/html/2606.11348#bib.bib8)。早期的启发式和元建模方法速度较快,因为它们依赖聚合或手工设计的特征来近似CTS行为[9](https://arxiv.org/html/2606.11348#bib.bib3)、[11](https://arxiv.org/html/2606.11348#bib.bib4)、[1](https://arxiv.org/html/2606.11348#bib.bib5)。因此,它们在未见过的设计上预测精度显著下降。现代的深度学习和生成式架构[19](https://arxiv.org/html/2606.11348#bib.bib7)、[15](https://arxiv.org/html/2606.11348#bib.bib8)[18](https://arxiv.org/html/2606.11348#bib.bib20)在孤立基准测试上解决了精度不足的问题,但它们缺乏跨设计环境所需的计算灵活性,因为物理设计经常涉及更新的约束和未见过的OOD宏架构。在EDA的机器学习领域,一个记录充分的现象是深度神经网络在应用于新设计时泛化能力差[4](https://arxiv.org/html/2606.11348#bib.bib12)[25](https://arxiv.org/html/2606.11348#bib.bib13)[7](https://arxiv.org/html/2606.11348#bib.bib14)。恢复精度需要生成海量新数据集并执行计算昂贵的重新训练周期。此外,它们的推理延迟过高,无法支持穷举设计空间探索所需的数百万次评估。因此,这些框架只能基于先验学习进行少量预测,而无法主动评估组合搜索空间以找到真正的全局最优解[15](https://arxiv.org/html/2606.11348#bib.bib8)。

参照图注
图1:SwiftCTS框架的高层概览。流程从布局数据的特征提取开始,随后是用于快速CTS指标预测的轻量级代理模型。K样本校准模块将预测对齐到新设计,NSGA-II优化器探索配置空间以生成帕累托最优解。

这一基本局限性引出了一个关键问题:是否可能设计一个能近乎即时适应新设计,且推理速度快到能在几分钟内评估数百万个配置的代理框架?为了回答这个问题,我们提出SwiftCTS,一个高速代理框架,旨在准确预测时钟树指标并驱动敏捷的设计空间探索(DSE)。本文的主要贡献如下:

- ∙ **敏捷代理架构**:我们提出一种超快速代理模型,摆脱了重型深度神经网络。通过利用梯度提升决策树,SwiftCTS实现亚毫秒级推理,并允许在数秒内从头重新训练完整的树集成,无需大量GPU时间。
- ∙ **K样本偏移校准**:我们引入一种新颖的校准技术,无需完全重新训练即可处理未见过的宏架构。通过评估新布局的仅一两次基线物理运行,代理在保持核心模型权重的同时,数学上将其预测对齐到新领域。
- ∙ **基于搜索的帕累托优化**:我们将快速预测引擎与多目标进化优化器集成。通过利用代理即时预测数百万个启发式配置下的CTS结果,该框架在几分钟内主动扫描设计空间,生成严格占优的帕累托前沿。

本文其余部分组织如下:第二部分讨论相关工作。第三部分详述SwiftCTS框架。第四部分和第五部分分别介绍实验设置和结果。第六部分进行讨论,最后在第七部分总结全文。

## II. 相关工作

为了自动化设计空间探索,研究人员提出了各种机器学习技术。这些方法可按其架构重点大致分类:

1) **聚合特征分析建模**:早期工作[9](https://arxiv.org/html/2606.11348#bib.bib3)利用基于规则的数据挖掘来估计时钟偏移和插入延迟。后续研究[11](https://arxiv.org/html/2606.11348#bib.bib4)、[1](https://arxiv.org/html/2606.11348#bib.bib5)采用高维元建模来预测更复杂的目标,如时钟功耗和线长,同时考虑非均匀负载分布和变化的版图宽高比。虽然高效,但它们依赖聚合或手工设计的特征,如门数、布线层、空白空间和版图宽高比来近似CTS行为。因此,它们在未见过的设计上预测精度显著下降,报告的相关性从近乎完美(1.0)降至低至0.48,且当代表性训练实例不可用时,相对误差超过20%。

2) **深度学习架构**:为了克服分析模型的局限性,近期文献转向深度学习架构。文献[19](https://arxiv.org/html/2606.11348#bib.bib7)的作者采用卷积神经网络(CNN)直接从CTS前的布局图像中估计CTS参数。Lu等人[15](https://arxiv.org/html/2606.11348#bib.bib8)将这种视觉方法推进一步,引入了生成对抗框架(GAN-CTS)。具体来说,他们的框架依赖EDA工具执行布局和试验布线,然后导出触发器分布、时钟网络分布和布线拥塞的高分辨率视觉地图,这些地图通过一个50层卷积网络处理以提取空间特征。通过将条件GAN与预训练的回归监督器结合在这些特征之上,他们的模型主动推荐CTS输入参数以优化功耗和线长。最近,缓解严重泛化下降[22](https://arxiv.org/html/2606.11348#bib.bib18)[23](https://arxiv.org/html/2606.11348#bib.bib19)的努力探索了复杂的迁移学习,例如解耦节点相关和设计相关的特征以对齐不同技术节点的数据。尽管精度高,所有这些架构的一个根本缺点是它们对数据的巨大依赖以及对重GPU加速的依赖。

3) **强化学习与生成/代理AI**:另一条并行研究方向将物理设计优化视为序列决策问题。例如,深度强化学习(RL)框架[8](https://arxiv.org/html/2606.11348#bib.bib22)[2](https://arxiv.org/html/2606.11348#bib.bib21)已被用于通过利用图神经网络和Transformer进行多阶段调优来调整布局参数。为了绕过RL对大量数据的需求,研究人员还应用贝叶斯优化(BO)来导航这些复杂的参数空间[6](https://arxiv.org/html/2606.11348#bib.bib23)、[24](https://arxiv.org/html/2606.11348#bib.bib24)。最后,基于LLM的智能体[20](https://arxiv.org/html/2606.11348#bib.bib25)[21](https://arxiv.org/html/2606.11348#bib.bib26)自动化了更广泛的流程,编排从RTL到GDSII的任务。尽管如此,RL、BO和AI框架的基本局限在于它们将实际的EDA工具保留在优化循环内。每次智能体需要评估奖励或测试新参数时,它必须执行物理工具。因此,这些方法只能找到一条好的轨迹,根本无法穷举扫描数百万个配置。

## III. SwiftCTS框架

在本节中,我们系统性地概述所提出的SwiftCTS架构。该框架以DEF、SAIF和时序路径报告为输入,输出帕累托最优的CTS配置及其预测的质量指标。SwiftCTS的核心组件包括共享特征提取器、独立预测头部、用于解决分布外(OOD)领域偏移的K样本校准模块,以及多目标进化优化器。对于任何给定的布局,特征引擎恰好一次解析输入报告,捕获芯片几何尺寸、单元混合、驱动强度和开关活动,构建一个详尽的110维物理特征空间(详见表格I(https://arxiv.org/html/2606.11348#S3.T1))。表格I(https://arxiv.org/html/2606.11348#S3.T1)中的数学公式专门设计为尺度不变,以处理严重的领域偏移。采用对数缩放来压缩特征,其中电路尺寸的高动态范围至关重要,而无量纲比率使代理能够学习不受绝对设计规模影响的通用密度模式。布局拓扑与CTS调优旋钮之间的显式交互项将模型建立在设计的底层物理基础上。最后,我们使用三个独立的预测头部,每个头部都有自己定制的特征空间(详见表格I(https://arxiv.org/html/2606.11348#S3.T1))和学习器架构,旨在捕捉其目标目标的特定物理特性。

### III-A. 预测头部设置

与深度学习常用的共享树干架构[15](https://arxiv.org/html/2606.11348#bib.bib8)不同,SwiftCTS采用三个独立的预测头部。这一设计选择基于梯度提升决策树的特性:它们一次只根据单个目标的梯度和方差统计来优化分裂。将共享树结构扩展到多个目标需要跨目标聚合这些统计量,这可能导致分裂选择偏向方差或尺度较大的目标,从而降低对其他指标的敏感性。为避免此类干扰,我们为每个目标训练独立的树集成,同时使用共同的特征表示。这确保了每个模型能够学习任务特定的特征空间划分,而不受影响。

#### III-A1. 功耗预测头部

功耗预测头部采用XGBoost集成[5](https://arxiv.org/html/2606.11348#bib.bib10),在20维特征空间上运行。在我们评估的基准测试套件中,不同设计系列间的时钟树功耗变化可达8.9倍,而在单个设计内部,不同CTS旋钮配置下的功耗变化仅为10–30%。预测一个完全未见过的设计系列的功耗本质上很困难,因为其绝对尺度完全未知,且对不同CTS旋钮的敏感性随设计而根本不同。功耗头部通过三种机制解决此问题:比率回归目标、基于物理的归一化器以及精心构建的特征空间。首先,目标被转换为无尺度对数比率:

\[
y_{\text{power}} = \log\left(\frac{\text{power}}{\text{pw\_norm}}\right) \tag{1}
\]

其中归一化器 \(\text{pw\_norm} = n_{\text{ff}} \times f_{\text{GHz}} \times \text{avg\_ds}\) 作为基于第一性原理的基线估计,直接源自动态时钟功耗方程 \(P = \alpha \times C_{\text{total}} \times V^2 \times f\)。通过预测对数比率,集成被严格限定为回归设计内部特定的10–30%功耗变化,而不是记忆每个设计的绝对基线。

#### III-A2. 线长预测头部

线长可利用已建立的VLSI布线理论[10](https://arxiv.org/html/2606.11348#bib.bib16)进行解析下限估计。我们利用这一特性构建一个尺度不变的目标,将宏观芯片尺寸与CTS工具所做的微观布线决策解耦。根据BHH定理和欧几里得几何,分布在面积 \(A\) 上的 \(N\) 个负载的最小斯坦纳树标度为 \(\sqrt{N \times A}\)。我们将其归一化为:

\[
\mathrm{wl}_{\mathrm{norm}} \propto \sqrt{n_{\mathrm{ff}} \cdot A} \tag{2}
\]

这近似于与触发器实际坐标或CTS配置无关的理论最小线长。然后我们将线长目标定义为 \(y_{\mathrm{wl}} = \log(\mathrm{WL}_{\mathrm{actual}} / \mathrm{wl}_{\mathrm{norm}})\),并通过 \(\mathrm{WL}_{\mathrm{pred}} = \exp(\hat{y}_{\mathrm{wl}}) \, \mathrm{wl}_{\mathrm{norm}}\) 恢复绝对线长。通过预测相对布线惩罚,我们确保模型能够无缝泛化到规模截然不同的设计。

该头部的学习架构混合了LightGBM[12](https://arxiv.org/html/2606.11348#bib.bib11)和岭回归[16](https://arxiv.org/html/2606.11348#bib.bib15)(使用30/70划分),在75维特征空间上运行(详见

相似文章

大海捞针:测试时模拟电路表示自适应用于贝叶斯优化

arXiv cs.LG

本文介绍了TTARO,一种在线深度核贝叶斯优化框架,它利用已评估的优值标签在测试时自适应电路表示。它提高了模拟电路拓扑搜索的样本效率,与标准贝叶斯优化相比,遗憾曲线下面积(regret AUC)减少了15.2%,与固定深度核学习相比减少了20.7%。

为代理式编码扩展测试时计算

Hugging Face Daily Papers

一种面向代理式编码的测试时扩展框架,可将 rollout 轨迹压缩为结构化摘要,并通过递归投票/PDR 将 Claude-4.5-Opus 在 SWE-Bench Verified 上的成绩提升至 77.6%。