Rule2DRC:通过执行引导测试生成对DRC脚本合成LLM代理的基准测试
摘要
Rule2DRC提出了一个大规模的DRC脚本合成基准,包含1000个任务和13,921个评估布局,并提出了SplitTester,它利用执行反馈来改善程序选择和功能正确性。
查看缓存全文
缓存时间: 2026/05/22 18:20
论文页面 - Rule2DRC: 基于执行引导测试生成的DRC脚本合成LLM智能体基准测试
来源:https://huggingface.co/papers/2605.15669
摘要
Rule2DRC 引入了一个大规模 DRC 脚本合成基准测试,包含 1,000 个规则到脚本的任务和 13,921 个评估布局,以及 SplitTester,它通过基于执行的反馈改进了程序选择。
可制造的芯片布局 (https://huggingface.co/papers?q=chip%20layouts) 必须满足数千条基于几何的设计规则,而设计规则检查 (https://huggingface.co/papers?q=design%20rule%20checking)(DRC)通过在布局上运行可执行的 DRC 脚本 (https://huggingface.co/papers?q=DRC%20scripts) 来强制执行这些规则。将自然语言规则 (https://huggingface.co/papers?q=natural%20language%20rules) 翻译成正确的 DRC 脚本 (https://huggingface.co/papers?q=DRC%20scripts) 是劳动密集型的,并且需要专业知识,这促使 LLM 智能体用于 DRC 脚本合成 (https://huggingface.co/papers?q=DRC%20script%20synthesis) 和调试。然而,现有基准测试的评估集较小,并且通常根据代码相似性而不是执行正确性来评估脚本,而先前的基于机器学习的方法要么忽略执行反馈 (https://huggingface.co/papers?q=execution%20feedback),要么需要将标记的测试布局作为智能体的输入。为此,我们引入了 Rule2DRC,一个用于 DRC 脚本编码智能体的大规模基准测试,包含 1,000 个规则到脚本的任务和 13,921 个用于基于执行评分的评估芯片布局 (https://huggingface.co/papers?q=chip%20layouts)。Rule2DRC 提供了一个评估流水线 (https://huggingface.co/papers?q=evaluation%20pipeline),它通过 DRC 执行结果衡量功能正确性 (https://huggingface.co/papers?q=functional%20correctness),而无需将评估布局作为智能体的输入。我们还提出了 SplitTester,一个用于程序选择 (https://huggingface.co/papers?q=program%20selection) 的测试器智能体,它使用执行反馈 (https://huggingface.co/papers?q=execution%20feedback) 生成具有判别性的测试用例,并区分先前无法区分的候选脚本,显著提高了该领域的 Best-of-N 选择 (https://huggingface.co/papers?q=Best-of-N%20selection) 性能。我们在 https://github.com/snu-mllab/Rule2DRC 上发布代码。
查看 arXiv 页面 (https://arxiv.org/abs/2605.15669)查看 PDF (https://arxiv.org/pdf/2605.15669)GitHub0 (https://github.com/snu-mllab/Rule2DRC)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15669)
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.15669 以从本页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.15669 以从本页面链接。
引用此论文的空间0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2605.15669 以从本页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 中以从本页面链接。
相似文章
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
MANTRA:为工具使用型 LLM 代理综合生成经 SMT 验证的合规基准
本文介绍了 MANTRA,这是一个从自然语言手册中自动综合生成经 SMT 验证的合规基准的框架,用于评估工具使用型 LLM 代理。研究表明,该方法能够实现对复杂程序规则遵循情况的可扩展且可靠的评估。
ReaComp:将LLM推理编译为符号求解器以实现高效程序合成
ReaComp将LLM推理轨迹编译为可重用的符号程序合成器,在程序合成基准测试中实现了强大的准确性,同时消除了测试时的LLM调用,显著降低了计算成本。
Agentick:用于通用序贯决策智能体的统一基准
本文介绍了 Agentick,这是一个用于评估涵盖强化学习(RL)、大型语言模型(LLM)和视觉语言模型(VLM)范式的通用序贯决策智能体的统一基准测试。该基准提供了 37 个程序化生成的任务,并揭示目前尚无单一方法占据主导地位,突显了智能体自主性方面仍有巨大的提升空间。
CDR-Bench:评估组合性、顺序敏感数据精炼指令的忠实执行能力
介绍CDR-Bench,一个包含3,462个任务的基准,用于评估LLM忠实执行组合性、顺序敏感数据精炼指令的能力。在10多个LLM上的实验表明,在组合性和顺序敏感的设置中性能显著下降,凸显了缺乏执行流程的忠实性。