面向LLM驱动HDL设计与验证数据策展的结构化测试台生成
摘要
本文提出STG,一种用于LLM驱动硬件设计工作流的结构化测试台生成框架,与现有基于提示的方法相比,它降低了token成本并提高了验证可靠性。
查看缓存全文
缓存时间: 2026/06/12 08:54
# 面向LLM驱动HDL设计与验证导向数据管理的结构化测试平台生成 来源: https://arxiv.org/html/2606.12983 黄恩铭¹, 高宇珩¹, 邓任浩¹, 辛玮柏¹, 谢曜廷², 梁成¹, 邹翔宇¹, 陈慕麒¹, 洪宇凯¹, 何绍钧¹, 黄柏翔¹, 洪士灏¹, 孔祥重³ ¹国立台湾大学, ²中央研究院, ³哈佛大学 [email protected], [email protected], [email protected] (https://arxiv.org/html/2606.12983v1/mailto:[email protected],%[email protected],%[email protected]) (2025) ###### 摘要. 自动化测试平台生成已成为大规模语言模型(LLM)驱动的寄存器传输级(RTL)工作流中的关键瓶颈,因为大量候选设计需要快速且可靠地验证。现有的基于提示的方法将测试平台生成视为无约束的代码合成,导致输出具有随机性、高令牌成本、低可重复性和覆盖不足。为解决这一差距,我们提出了STG(结构化测试平台生成框架),该框架利用硬件设计的固有结构来生成确定性测试平台。作为直接验证工具,STG比基于LLM的迭代测试平台生成流程快720倍,编译成功率更高,覆盖率更高,并且减少了错误DUT上的误通过判决。STG还能通过暴露有缺陷的基准测试平台,帮助识别RTL生成基准测试中的错误。作为数据管理引擎,它在单个CPU核心上比基于LLM的过滤快11倍,能耗降低127倍,生成的蒸馏模型在我们的多基准评估中提供了最先进的性能。作为测试时缩放先知,它减少了14-47%的节点数。我们的模型可在 https://huggingface.co/collections/AS-SiliconMind/siliconmind-v12 获取。 ††版权:acmlicensed ††期刊年份:2025 ††DOI:XXXXXXX.XXXXXXX ††ISBN:XXX-X-XXXX-XXXX-X/2026/07 ## 1. 引言 功能验证仍然是硬件设计中最耗人力的阶段之一。随着寄存器传输级(RTL)设计复杂度的增加,构建能够暴露边角情况的测试平台需要大量的人工努力。先前的工作探索了通过有限状态机(FSM)建模(Chow1978FSM)、覆盖引导仿真(Amla2001BiasedRandom)和概率方法(Ferens2003Bayesian)来自动生成激励,但实际的测试平台开发仍然是一个主要瓶颈。在大语言模型(LLM)时代,这一挑战变得更加严峻,因为硬件描述语言(HDL)代码现在可以从自然语言大规模生成。最近的LLM驱动硬件设计系统使用生成的验证工件进行规格到RTL的评估、数据集构建和测试时反馈(Liu2024AutoBench; Liu2025CorrectBench; Liu2025ConfiBench; Yao2025CodeV; Chen2026SiliconMindV1)。在此类设置中,验证不再仅仅是下游设计步骤;它成为验证生成的HDL工件、过滤低质量输出以及组织后续模型改进数据的核心机制。 尽管如此,我们观察到现有的基于LLM的测试平台生成方法(Liu2024AutoBench; Liu2025CorrectBench; Liu2025ConfiBench; teng2025verirl)被框定为无约束代码生成,这导致了两个局限性。首先,由于测试平台是通过LLM的随机过程生成的,提高可靠性需要迭代提示或集成生成,从而增加令牌成本。其次,这种表述忽略了基于仿真的验证的结构化特性:模块实例化、输出检查和报告可以直接生成,而核心挑战归结为产生高覆盖率的激励。 这些局限性因LLM驱动HDL工作流中的几个新兴需求而被放大。测试时缩放技术——例如基于蒙特卡洛树搜索(MCTS)的工作流搜索(wei2026vflow)和进化细化(novikov2025alphaevolve; min2026revolution)——现在将验证置于迭代优化循环内部,每个候选修订必须在搜索进行之前快速且可靠地评估;一个嘈杂的验证信号直接降低了搜索效率和质量。模型蒸馏流水线生成大量候选DUT,这些DUT在用作训练数据之前必须经过验证(QiMeng2025CodeVR1; teng2025verirl; Chen2026SiliconMindV1);弱或不稳定的测试平台会对候选设计进行错误分类,引入噪声标签,并降低管理数据集的价值。这种成本压力随着LLM训练转向持续学习(模型在新数据上反复重新训练)(2025continuelearningsurvey)以及蒸馏的较小模型发现新角色(例如加速大模型推理的推测解码草稿模型(2023specdec))而进一步加剧。所有这些设置都要求一种低成本、可扩展到大量候选设计的验证机制。 在这项工作中,我们提出了STG(结构化测试平台生成框架),它结合了轻量级HDL分析和基于模板的渲染,以确定性地为组合电路和通用时序电路生成测试平台。STG旨在作为LLM驱动HDL工作流的通用验证后端,支持三个紧密相关的场景:(i) 直接RTL验证,其中候选设计与黄金参考进行验证;(ii) 验证导向的数据集管理,因为大量生成的工件在用作训练数据之前必须被过滤;以及 (iii) 测试时缩放,其中必须在LLM引导的细化循环的每次迭代中提供可靠的验证反馈。 我们在Verilog生成基准测试(Liu2023VerilogEval; Thakur2024RevisitingVerilogEval)上评估了STG及其应用。STG生成测试平台比基于LLM的迭代测试平台生成流水线(Liu2025ConfiBench)快720倍,具有更高的行覆盖率和翻转覆盖率,并且在错误DUT上产生更少的误通过判决。对于数据管理,STG在CPU核心上比基于LLM的过滤快10.6倍,能耗降低127倍,并且我们简单的监督微调(SFT)流水线在我们的多基准评估(Liu2023VerilogEval; Thakur2024RevisitingVerilogEval; pinckney2025cvdp; lu2024rtllm)中取得了有竞争力或更优的结果,同时使用了比最近的专业基线(teng2025verirl; QiMeng2025CodeVR1; Chen2026SiliconMindV1)更少的训练数据。在测试时缩放中,STG在现有LLM(Chen2026SiliconMindV1; openai2025gptoss; Guo2025deepseek)上将已解决问题节点数减少了14-47%。我们还通过STG的确定性生成和人工检查,发现并纠正了VerilogEval测试平台(Liu2023VerilogEval; Thakur2024RevisitingVerilogEval)中系统性的竞争条件。我们的结果进一步表明,近期复杂的训练和强化学习工作流(teng2025verirl; QiMeng2025CodeVR1)的有效性仍然存疑。 我们的主要贡献有三个:(1) 我们提出了STG,一个用于RTL验证的确定性和结构感知的测试平台生成框架,在效率、覆盖率和可靠性方面优于基于提示的LLM测试平台生成方法。(2) 我们展示了STG能够实现高效的验证导向数据管理,并使用简单的流水线支持强大的蒸馏RTL生成模型。(3) 我们证明了STG作为LLM驱动RTL细化流程的有效验证后端,提高了多个骨干模型的搜索质量和效率。我们的模型可在 https://huggingface.co/collections/AS-SiliconMind/siliconmind-v12 获取。 本文其余部分组织如下。第2节回顾了基于LLM的测试平台生成和验证导向RTL工作流的相关工作。第3节介绍了STG框架。第4节描述了STG的应用。第5节展示了实验结果,第6节总结了全文。 ## 2. 问题定义与背景 本节形式化定义了STG所解决的验证问题。我们定义了已知参考RTL验证设置及其要求,回顾了现有的基于LLM的测试平台生成工作流,并讨论了测试时缩放和数据管理如何对测试平台质量产生额外需求。 ### 2.1. 已知参考RTL验证 我们考虑已知参考RTL验证设置。给定一个待测设计(DUT)D和一个可信的黄金实现G,目标是自动构建一个测试平台T,将有效激励应用于D,将其行为与G进行比较,并确定D是否功能正确。生成的测试平台必须满足三个实际要求:(i) 产生可信的通过/失败判断,(ii) 实现高行为覆盖率,特别是针对控制和状态相关行为,(iii) 生成成本低,以便扩展到大量RTL候选设计。 该设置在当前的LLM驱动RTL工作流中广泛适用,其中黄金参考通常是可用的:RTL生成基准测试附带参考实现(Liu2023VerilogEval; Thakur2024RevisitingVerilogEval; lu2024rtllm; pinckney2025cvdp),测试时缩放系统针对已知规范生成候选设计(wei2026vflow; min2026revolution),数据管理流水线针对可信解过滤LLM输出(Yao2025CodeV; QiMeng2025CodeVR1; Chen2026SiliconMindV1)。因此,已知参考假设涵盖了第1节中介绍的三个用例:*直接RTL验证*、*验证导向数据管理* 和 *测试时缩放*。因此我们将目标问题形式化为“面向验证分类的结构化测试平台生成”:给定D和G,生成一个揭示D有意义行为、产生可信通过/失败决策、并可扩展到大量生成的RTL候选设计的测试平台。 ### 2.2. 基于LLM的测试平台生成方法 一系列先前的工作——AutoBench(Liu2024AutoBench)、CorrectBench(Liu2025CorrectBench)和ConfiBench(Liu2025ConfiBench)——解决了没有可信参考的开放式设置,LLM必须从头合成激励和*银参考*预言。*银参考*是由LLM产生的同一规范的另一种实现(例如,用C++或Python的行为模型),在没有权威黄金参考时用作替代预言。虽然这些方法通过自我纠正和集成逐步提高了生成质量,但它们共享一个根本的模糊性:当DUT和预言都由同一随机过程产生时,不匹配无法明确归因于DUT中的错误还是预言中的错误,使得通过/失败判决本质上不可靠。本工作中假定的已知参考设置通过假定手中有可信的黄金参考G消除了这种模糊性,因此任何差异都明确是DUT的故障。这将问题从开放式代码合成转变为高效、高覆盖率的激励生成。 ### 2.3. 测试时缩放与验证导向数据管理 对高效已知参考验证的需求因LLM驱动RTL生成中的两个近期趋势而放大,这两个趋势都严重依赖验证质量:测试时缩放和验证导向数据管理。 **测试时缩放。** 近期的基于LLM的RTL生成系统已从一次性提示转向推理时的迭代搜索和细化,将验证置于优化循环内部而非之后(wei2026vflow; min2026revolution; Dong2025ScaleRTL)。架构模式各不相同,但都有一个共同的要求:在每次迭代中,系统必须评估每个候选设计,并使用结果来决定接下来生成什么。这使得测试平台成为生成过程本身的性能关键组件。一个嘈杂或不可靠的验证信号可能导致搜索保留有缺陷的候选设计、拒绝正确的候选设计,或在模糊反馈上浪费迭代。因此,测试平台不仅必须正确,还必须快速生成、确定性、且信息足够丰富以区分部分正确的设计与完全错误的设计。 **验证导向数据管理。** 一个并行的发展是越来越多地使用模型蒸馏和强化学习来训练专门用于RTL生成的小型思考模型(teng2025verirl; Yao2025CodeV; QiMeng2025CodeVR1; Chen2026SiliconMindV1)。这些流水线产生大量候选DUT(通常配有推理轨迹或辅助工件),这些候选DUT在用作训练数据之前必须经过验证和分类。然而,过滤阶段的验证工件通常仍通过基于提示的LLM处理,这在筛选大型数据集时成本高昂。此阶段弱或不稳定的测试平台还可能对候选设计进行错误分类,引入噪声标签,并降低管理数据集的质量(QiMeng2025CodeVR1; Chen2026SiliconMindV1)。目前,不存在能够廉价且可重复地过滤大量候选设计而无需每次任务都需要LLM调用的机制(QiMeng2025CodeVR1; teng2025verirl; Chen2026SiliconMindV1)。 这两个趋势都重新定义了LLM驱动RTL流水线中验证的角色。验证不再仅仅用于判断生成的DUT是否正确;它还提供搜索循环内部的反馈信号和训练数据构建的质量门控。因此,验证引擎成为模型改进核心基础设施的一部分,这使得低成本、可重复且行为上有意义的测试平台生成变得特别有价值。 ## 3. STG: 结构化测试平台生成 参见图注 图1. STG整体工作流。STG主要设计用于DUT和黄金参考均可用的场景,同时仍可扩展到§2.2中讨论的银参考设置。红线对应STG的主要工作流;蓝线表示扩展到银参考设置。黑线是两个设置的通用步骤。 图1展示了STG的整体流程。该框架将DUT和黄金参考作为输入。STG首先分析HDL结构,然后根据检测到的设计类型确定性地生成测试平台,最后编译并执行测试平台以获得通过/失败统计数据和覆盖率信息。测试平台是从参数化的Jinja模板渲染而来,模板填充了提取的模块信息,包括端口列表、信号角色和设计类型特定参数。 在本节中,我们首先描述模块解析和分析过程,该过程从HDL代码中提取必要信息以指导生成。然后,我们介绍针对组合电路、通用时序电路和FSM主导设计的不同激励生成策略。最后,我们讨论如何将STG扩展到没有可信黄金参考可用而使用LLM生成的银参考的场景,如第2.2节讨论的工作流中所做的那样。
相似文章
Alpha-RTL:用于 RTL 硬件优化的测试时训练
Alpha-RTL (TTT-RTL) 引入了一种用于 RTL 硬件优化的测试时训练框架,利用带有 EDA 反馈的强化学习来优化 LLM 生成的设计。它在基准测试上实现了显著的 PPA 减少。
LLM生成的SystemVerilog断言对语义保持RTL变换的鲁棒性
本文评估了LLM生成的SystemVerilog断言在语义保持RTL变换下的鲁棒性,发现点精度可能隐藏了显著的不稳定性,并倡导在AI辅助硬件验证中进行鲁棒性感知评估。
RTL-BenchMT: 通过智能体辅助分析与修订实现RTL生成基准的动态维护
RTL-BenchMT是一个智能体框架,能够自动识别并修正有缺陷的案例,检测RTL生成基准中的过拟合问题,从而减少EDA研究中的人工维护工作。
CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation
This paper introduces CHORUS, a post-training framework that uses staged supervised fine-tuning and reinforcement learning to create complementary expert models, which are then merged or distilled into a single 4B model that achieves 88.0% Pass@1 on the CVDP-ECov testbench stimulus generation benchmark, outperforming DeepSeek-R1.
LGMT:基于逻辑的变形测试用于评估LLM推理可靠性
本文介绍了LGMT,这是一个利用一阶逻辑生成语义不变测试用例以评估LLM推理可靠性的框架。在六个LLM上的实验表明,LGMT暴露了静态基准遗漏的隐藏缺陷,提示评估应侧重于逻辑不变性下的鲁棒性。