Rule2DRC:通过执行引导测试生成对DRC脚本合成LLM代理的基准测试

Hugging Face Daily Papers 论文

摘要

Rule2DRC提出了一个大规模的DRC脚本合成基准,包含1000个任务和13,921个评估布局,并提出了SplitTester,它利用执行反馈来改善程序选择和功能正确性。

可制造的芯片布局必须满足成千上万条基于几何的设计规则,设计规则检查(DRC)通过运行可执行的DRC脚本来强制执行这些规则。将自然语言规则翻译成正确的DRC脚本是劳动密集型的,并且需要专业知识,这促使了LLM代理用于DRC脚本合成和调试。然而,现有的基准测试评估集较小,并且通常根据代码相似性而非执行正确性来评估脚本,而先前的基于机器学习的方法要么忽略执行反馈,要么需要将标记的测试布局作为代理的输入。为此,我们引入了Rule2DRC,这是一个大规模的DRC脚本编码代理基准测试,包含1000个规则到脚本的任务和13,921个评估芯片布局,用于基于执行的评分。Rule2DRC提供了一个评估流水线,通过DRC执行结果测量功能正确性,而无需将评估布局作为代理的输入。我们还提出了SplitTester,一个用于程序选择的测试代理,它利用执行反馈生成有判别力的测试用例,并区分以前无法区分的候选脚本,显著提高了该领域中Best-of-N选择的性能。我们在https://github.com/snu-mllab/Rule2DRC上发布代码。
查看原文
查看缓存全文

缓存时间: 2026/05/22 18:20

论文页面 - Rule2DRC: 基于执行引导测试生成的DRC脚本合成LLM智能体基准测试

来源:https://huggingface.co/papers/2605.15669

摘要

Rule2DRC 引入了一个大规模 DRC 脚本合成基准测试,包含 1,000 个规则到脚本的任务和 13,921 个评估布局,以及 SplitTester,它通过基于执行的反馈改进了程序选择。

可制造的芯片布局 (https://huggingface.co/papers?q=chip%20layouts) 必须满足数千条基于几何的设计规则,而设计规则检查 (https://huggingface.co/papers?q=design%20rule%20checking)(DRC)通过在布局上运行可执行的 DRC 脚本 (https://huggingface.co/papers?q=DRC%20scripts) 来强制执行这些规则。将自然语言规则 (https://huggingface.co/papers?q=natural%20language%20rules) 翻译成正确的 DRC 脚本 (https://huggingface.co/papers?q=DRC%20scripts) 是劳动密集型的,并且需要专业知识,这促使 LLM 智能体用于 DRC 脚本合成 (https://huggingface.co/papers?q=DRC%20script%20synthesis) 和调试。然而,现有基准测试的评估集较小,并且通常根据代码相似性而不是执行正确性来评估脚本,而先前的基于机器学习的方法要么忽略执行反馈 (https://huggingface.co/papers?q=execution%20feedback),要么需要将标记的测试布局作为智能体的输入。为此,我们引入了 Rule2DRC,一个用于 DRC 脚本编码智能体的大规模基准测试,包含 1,000 个规则到脚本的任务和 13,921 个用于基于执行评分的评估芯片布局 (https://huggingface.co/papers?q=chip%20layouts)。Rule2DRC 提供了一个评估流水线 (https://huggingface.co/papers?q=evaluation%20pipeline),它通过 DRC 执行结果衡量功能正确性 (https://huggingface.co/papers?q=functional%20correctness),而无需将评估布局作为智能体的输入。我们还提出了 SplitTester,一个用于程序选择 (https://huggingface.co/papers?q=program%20selection) 的测试器智能体,它使用执行反馈 (https://huggingface.co/papers?q=execution%20feedback) 生成具有判别性的测试用例,并区分先前无法区分的候选脚本,显著提高了该领域的 Best-of-N 选择 (https://huggingface.co/papers?q=Best-of-N%20selection) 性能。我们在 https://github.com/snu-mllab/Rule2DRC 上发布代码。

查看 arXiv 页面 (https://arxiv.org/abs/2605.15669)查看 PDF (https://arxiv.org/pdf/2605.15669)GitHub0 (https://github.com/snu-mllab/Rule2DRC)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15669)

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.15669 以从本页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.15669 以从本页面链接。

引用此论文的空间0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2605.15669 以从本页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 中以从本页面链接。

相似文章

Agentick:用于通用序贯决策智能体的统一基准

arXiv cs.AI

本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。