SKILL:自纠正知识引导的迭代大语言模型代理用于逻辑优化
摘要
SKILL是一种自纠正知识引导的迭代大语言模型代理,统一了多代理LLM推理和基于强化学习的交互,用于逻辑综合优化,实现了相比专家流程的显著改进。
arXiv:2608.14579v1 公告类型:新
摘要:逻辑综合优化因搜索空间指数级增长、奖励信号稀疏和逻辑结构多样而面临重大挑战。传统专家设计的流程缺乏适应性,而强化学习(RL)方法通常样本效率低且可解释性有限。我们引入SKILL,一种自纠正知识引导的迭代大语言模型代理,统一了多代理LLM推理和基于强化学习的环境交互,用于自动化合成优化。SKILL协调三个专门的LLM:GPT-4o用于战略规划,Claude Sonnet 4用于详细推理,Gemini 2.5 Pro用于高效分析,并与一个基于PPO的RL代理结合,该代理通过与合成工具的直接交互学习可操作的策略。一个新颖的自纠正模块监控环境反馈(PDA指标),检测次优行为,并调用LLM引导的恢复策略。在IWLS、OpenCores和EPFL基准测试上的评估显示,SKILL在逻辑系统高达50万门的情况下,实现了相比专家流程12.4%的PDA改进和86.3%的成功率。
查看缓存全文
缓存时间: 2026/08/18 09:46
# 技能:自纠正知识引导的迭代大语言模型智能体在逻辑优化中的应用
来源:https://arxiv.org/html/2608.14579
###### 摘要
逻辑综合优化由于搜索空间呈指数级增长、奖励信号稀疏以及逻辑结构多样而面临巨大挑战。传统的专家设计流程缺乏适应性,而强化学习方法通常样本效率低且可解释性有限。我们提出SKILL,这是一种自纠正知识引导的迭代大语言模型智能体,它统一了多智能体LLM推理和基于强化学习的环境交互,以实现自动化的综合优化。SKILL协调三个专用的大语言模型——GPT-4o用于战略规划,Claude Sonnet 4用于详细推理,Gemini 2.5 Pro用于高效分析——以及一个基于PPO的强化学习智能体,该智能体通过与综合工具的直接交互学习可执行策略。一个新颖的自纠正模块监控环境反馈(PDA指标),检测次优行为,并调用LLM引导的恢复策略。在IWLS、OpenCores和EPFL基准测试上的评估表明,SKILL相对于专家流程实现了12.4±2.1%的PDA改进,在多达50万门的逻辑系统上成功率达到86.3%。
## 1引言
随着数字系统复杂性的增长,逻辑综合已成为现代设计流程中关键的优化阶段。传统的电子设计自动化流程通常依赖专家编写的脚本,通过ABCbrayton2010abc (https://arxiv.org/html/2608.14579#bib.bib1)和Yosyswolf2013yosys (https://arxiv.org/html/2608.14579#bib.bib2)等工具运行。虽然在受限领域有效,但这些静态方法难以适应多样化的逻辑拓扑和技术节点hosny2020drills (https://arxiv.org/html/2608.14579#bib.bib3);rose2024robust (https://arxiv.org/html/2608.14579#bib.bib4)。此外,优化操作的搜索空间随系统规模呈指数级增长,使得穷举策略变得不切实际。
强化学习提供了一种有前景的替代方案,通过学习能自适应指导优化决策的策略sutton2018reinforcement (https://arxiv.org/html/2608.14579#bib.bib15);puterman2014markov (https://arxiv.org/html/2608.14579#bib.bib14)。DRiLLShosny2020drills (https://arxiv.org/html/2608.14579#bib.bib3)和EasySOzhao2024easyso (https://arxiv.org/html/2608.14579#bib.bib5)等框架将综合建模为序列决策任务,允许智能体探索改进逻辑功耗-延迟-面积指标的操作序列。然而,强化学习智能体必须通过环境交互来学习——这是一个闭环,其中每个动作修改逻辑状态,随后的PDA反馈决定奖励。这种交互因信号稀疏、结果延迟和高维空间而变得复杂shi2024lsoformer (https://arxiv.org/html/2608.14579#bib.bib7),这是一个具有挑战性的组合优化问题papadimitriou1998combinatorial (https://arxiv.org/html/2608.14579#bib.bib23);garey1979computers (https://arxiv.org/html/2608.14579#bib.bib25)。
与此同时,大语言模型在代码理解、结构化推理和长期规划方面表现出强大的能力brown2020language (https://arxiv.org/html/2608.14579#bib.bib8);openai2023gpt4 (https://arxiv.org/html/2608.14579#bib.bib9);vaswani2017attention (https://arxiv.org/html/2608.14579#bib.bib48)。BERTdevlin2018bert (https://arxiv.org/html/2608.14579#bib.bib49)、GPT系列radford2019language (https://arxiv.org/html/2608.14579#bib.bib50);achiam2023gpt (https://arxiv.org/html/2608.14579#bib.bib51)、LLaMAtouvron2023llama (https://arxiv.org/html/2608.14579#bib.bib52)和PaLMchowdhery2022palm (https://arxiv.org/html/2608.14579#bib.bib53)等强大架构的涌现,展示了在复杂推理任务中显著的涌现能力wei2022emergent (https://arxiv.org/html/2608.14579#bib.bib54)。这些模型展现出复杂的上下文学习能力min2022rethinking (https://arxiv.org/html/2608.14579#bib.bib55);dong2022survey (https://arxiv.org/html/2608.14579#bib.bib56),使其特别适合需要自适应策略制定的优化问题。新兴研究正在探索其在逻辑设计任务中的应用,但很少有研究将LLM与底层工具链集成以实现闭环优化。
我们提出SKILL,一种将LLM推理与基于强化学习的环境交互相结合的多智能体架构,用于逻辑综合。LLM提供高层策略、根本原因分析和纠正规划,而PPO智能体schulman2017proximal (https://arxiv.org/html/2608.14579#bib.bib16)则基于奖励驱动的学习sutton2018reinforcement (https://arxiv.org/html/2608.14579#bib.bib15)执行细粒度的工具调用。一种新颖的自纠正机制监控优化轨迹,并在检测到性能下降时重新启用LLM,以解决组合优化的根本挑战korte2012combinatorial (https://arxiv.org/html/2608.14579#bib.bib24);nemhauser1988integer (https://arxiv.org/html/2608.14579#bib.bib22)。
我们的主要贡献包括:
1. 1\.多智能体LLM-强化学习架构:我们将三个专用的大语言模型与PPO智能体相结合,以连接抽象推理和底层综合动作空间。
2. 2\.自纠正优化循环:我们提出一种机制,使用环境PDA反馈来检测次优决策、调用故障诊断并触发基于LLM的纠正计划。
3. 3\.分层动作分解:两级抽象连接LLM指导和可执行的工具动作,提高学习效率。
4. 4\.可扩展的基准测试:我们在多达50万门的IWLS、OpenCores和EPFL逻辑系统上验证了SKILL,相比专家流程和仅强化学习基线均取得了持续改进。
## 2相关工作
### 2\.1强化学习在逻辑综合中的应用
强化学习在电子设计自动化领域中日益受到关注,用于优化布局mirhoseini2021graph (https://arxiv.org/html/2608.14579#bib.bib10)、布线和逻辑综合流程。DRiLLShosny2020drills (https://arxiv.org/html/2608.14579#bib.bib3)表明,逻辑综合可以建模为马尔可夫决策过程puterman2014markov (https://arxiv.org/html/2608.14579#bib.bib14),其中每个动作修改逻辑并基于结果质量指标产生奖励。虽然有效,但它在收敛性和泛化性方面面临挑战。
后续工作如EasySOzhao2024easyso (https://arxiv.org/html/2608.14579#bib.bib5)引入了混合PPO模型schulman2017proximal (https://arxiv.org/html/2608.14579#bib.bib16),以实现更高的样本效率和更好的奖励传播。BOiLSgrosnit2022boils (https://arxiv.org/html/2608.14579#bib.bib6)应用贝叶斯优化shahriari2015taking (https://arxiv.org/html/2608.14579#bib.bib45);brochu2010tutorial (https://arxiv.org/html/2608.14579#bib.bib47)来导航工具操作序列。尽管如此,这些方法仍然受到稀疏PDA反馈和缺乏可解释性的限制——SKILL通过LLM引导的探索和基于环境交互的自纠正反馈循环解决了这些问题。
### 2\.2大语言模型在逻辑设计中的应用
大语言模型在逻辑任务中的应用发展迅速。最近的工作展示了在逻辑理解、提高代码质量和验证覆盖率方面的应用。RTLCoder展示了在从语言提示生成RTL时87%的正确率,超越了早期的模型。
对于模拟设计,各种方法使用LLM进行拓扑综合和参数估计,在实际约束下实现了更高的成功率。综述强调了LLM通过自然语言接口自动化和加速EDA阶段的潜力。然而,大多数工作仍局限于一次性生成或静态分析,而非持续的工具链反馈循环。
### 2\.3多智能体协作与LLM架构
多智能体LLM系统的最新进展表明,将复杂推理分配给专门智能体的价值。AutoGenwu2023autogen (https://arxiv.org/html/2608.14579#bib.bib11)和MetaGPThong2023metagpt (https://arxiv.org/html/2608.14579#bib.bib12)表明,基于角色的LLM智能体协作提高了软件任务的成功率。
SKILL采用了这一原则,分配不同的角色——战略规划(GPT-4o)、详细分析(Claude)和结构细化(Gemini)——并通过强化学习智能体进行集中协调。智能体在闭环环境交互循环中运行,其中PDA结果为未来决策提供信息并触发自适应纠正。
## 3SKILL框架
### 3\.1问题建模与理论基础
我们将逻辑优化建模为增强的部分可观察马尔可夫决策过程,纳入了多智能体LLM指导和自纠正机制。逻辑优化的常规强化学习建模包括元组M=⟨S,A,T,R,O,Ω⟩\\mathcal\{M\}=\\langle\\mathcal\{S\},\\mathcal\{A\},\\mathcal\{T\},\\mathcal\{R\},\\mathcal\{O\},\\Omega\\rangle,其中:
- •S\\mathcal\{S\}:状态空间,表示逻辑配置,包括结构特征、时序特性、功耗概况和技术参数。
- •A\\mathcal\{A\}:动作空间,包含可用的优化变换,包括逻辑优化操作和技术映射决策。
- •T:S×A→Δ\(S\)\\mathcal\{T\}:\\mathcal\{S\}\\times\\mathcal\{A\}\\rightarrow\\Delta\(\\mathcal\{S\}\):转移函数,表示基于EDA工具执行结果的确定性变换。
- •R:S×A→R\\mathcal\{R\}:\\mathcal\{S\}\\times\\mathcal\{A\}\\rightarrow\\mathbb\{R\}:奖励函数,基于功耗-延迟-面积乘积优化和约束满足指标。
我们扩展此建模以创建SKILL-POMDP:MSKILL=⟨S,A,T,R,O,Ω,G,C,E⟩\\mathcal\{M\}\_\{SKILL\}=\\langle\\mathcal\{S\},\\mathcal\{A\},\\mathcal\{T\},\\mathcal\{R\},\\mathcal\{O\},\\Omega,\\mathcal\{G\},\\mathcal\{C\},\\mathcal\{E\}\\rangle,引入:
- •G\\mathcal\{G\}:LLM指导空间,包含来自多智能体集成的战略见解和优化建议。
- •C\\mathcal\{C\}:自纠正反馈空间,包括故障检测信号和纠正行动提案。
- •E\\mathcal\{E\}:集成协调空间,管理智能体间通信协议和共识建立机制。
优化目标是找到最优策略π∗\\pi^{\*\},最大化期望累积奖励bellman1957dynamic (https://arxiv.org/html/2608.14579#bib.bib13);sutton2018reinforcement (https://arxiv.org/html/2608.14579#bib.bib15),同时有效利用多智能体LLM指导和自纠正机制:
π∗=argmaxπEτ∼π\[∑t=0TγtR\(st,at\)\+α⋅G\(st,gt\)\+β⋅C\(st,ct\)\]\\pi^\{\*\}=\\arg\\max\_\{\\pi\}\\mathbb\{E\}\_\{\\tau\\sim\\pi\}\\left\[\\sum\_\{t=0\}^\{T\\gamma^\{t\}R\(s\_\{t\},a\_\{t\}\)\+\\alpha\\cdot G\(s\_\{t\},g\_\{t\}\)\+\\beta\\cdot C\(s\_\{t\},c\_\{t\}\)\\right\]
其中τ\\taurepresents an optimization trajectory,gt∈Gg\_\{t\}\\in\\mathcal\{G\}encodes LLM guidance,ct∈Cc\_\{t\}\\in\\mathcal\{C\}represents self\-correcting feedback, and hyperparametersα,β\\alpha,\\betacontrol the relative influence of guidance and correction terms\.
### 3\.2系统架构概述
EDA ToolsInputFeatureExtractionConsensusLLM\(Strategy\)LLM\(Analysis\)RL ModulesActorCriticMemoryReward SignalPDA EvaluationSelf\-CorrectingFailureDetectionRoot CauseAnalysisCorrectiveActionRewriteRefactorBalanceResubMetrics图 1:SKILL 系统架构:清晰框架展示了多 LLM 协作推理、强化学习优化、自纠正机制和 EDA 工具接口的集成,具有改进的视觉组织结构。SKILL 框架在层次化架构内编排多个相互关联的组件,旨在跨多样化工业应用实现可扩展的逻辑优化。图 1(https://arxiv.org/html/2608.14579#S3.F1)展示了完整的系统架构,具有改进的视觉组织结构,突出了清晰的信息流和组件交互。
### 3\.3多 LLM 协作集成
SKILL 的基础创新在于其复杂的多模型协作方法,其中专用的 LLM 通过协调的决策机制协同组合其能力。
GPT-4o - 战略规划专家:GPT-4o 作为主要的战略协调者,负责高层优化方向和全面的长期规划。其核心能力包括逻辑可视化的多模态分析、融入复杂 PDA 权衡考虑的战略优化规划、上下文感知的自适应机制以及长期优化轨迹规划。
Claude Sonnet 4 - 分析专家:Claude Sonnet 4 专门从事详细的逻辑分析和系统化的优化机会识别。其核心功能包括深入的逻辑拓扑结构分析和精确的关键路径识别、全面的瓶颈检测、用于识别设计模式的高级模式识别以及详细解释生成。
Gemini 2.5 Pro - 高效处理专家:Gemini 2.5 Pro 管理快速处理任务,并在整个优化过程中提供实时的优化反馈。其主要职责包括实时反馈生成、针对大规模数据库的高效模式匹配、优化提案的快速评估以及优化策略的动态调整。
这三个 LLM 通过一个复杂的共识机制协作,系统地将它们的多元化见解整合成连贯的优化策略。算法 1(https://arxiv.org/html/2608.14579#alg1)详细描述了协作分析过程。
算法 1 多 LLM 协作分析协议
1: 逻辑状态 s_t,优化历史 H_t,设计约束 C
2: 协作指导 guidance,附带置信度指标
3: 阶段 1:并行分析
4: insight_gpt ← GPT-4o.analyze(s_t, H_t, C, role="strategic")
5: insight_claude ← Claude.analyze(s_t, H_t, C, role="analytical")
6: insight_gemini ← Gemini.analyze(s_t, H_t, C, role="efficient")
7: 阶段 2:交叉验证
8: conflicts ← IdentifyConflicts(insight_gpt, insight_claude, insight_gemini)
9: if |conflicts| > threshold_conflict then
10: resolved_insights ← ResolveConflicts(conflicts, s_t, C)
11: end if
12: 阶段 3:共识构建
13: weights ← DynamicWeightCalculation(confidence_scores)
14: consensus ← WeightedConsensus(insights, weights)
15: 阶段 4:策略生成
16: guidance ← GenerateActionableGuidance(consensus, s_t, H_t)
17: return guidance
### 3\.4集成 LLM 的强化学习智能体
强化学习组件采用改进的近端策略优化架构schulman2017proximal (https://arxiv.org/html/2608.14579#bib.bib16),系统地将多 LLM 指导作为增强输入特征,同时利用层次化动作相似文章
SKILL-KD:面向LLM智能体的对比技能蒸馏
SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。
SkillDAG:大规模LLM技能选择中的自进化类型化技能图
介绍了SkillDAG,一种用于大规模LLM技能选择的自进化类型化有向图,它建模了技能间关系,并允许智能体在执行过程中查询和演化该图,在ALFWorld和SkillsBench上优于基线。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
Formal Skill: 面向高效精准LLM智能体的可编程运行时技能
本文介绍了Formal Skill,这是一种面向LLM智能体的运行时原生抽象,它将可重用流程编码为可执行状态机,配有JSON元数据、Python执行器和钩子控制的逻辑。还介绍了一个名为FairyClaw的开源实现,在Harness-Bench上展示了具有竞争力的性能,且减少了token使用量。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。