ANNEAL: 通过受控符号补丁学习适配LLM代理
摘要
介绍了ANNEAL,一种神经符号代理,能将重复性故障转化为过程知识图谱的受控符号编辑,无需修改模型权重,在测试环境中实现持久的结构修复并消除重复性故障。
arXiv:2605.16309v1 公告类型:新
摘要:基于LLM的代理可以从单个执行错误中恢复,但当底层过程知识——操作模式、前置条件和约束——未得到修复时,它们会在同一故障上反复失败。现有的自演进方法通过更新提示、记忆或模型权重来弥补这一缺口,但没有一种方法直接修复编码任务执行方式的符号结构,且很少有方法提供安全部署所需的治理保证。我们引入了ANNEAL,一种神经符号代理,它将重复性故障转化为过程知识图谱的受控符号编辑,而不修改基础模型权重。其核心机制——故障驱动知识获取(FDKA)——定位负责的操作器,通过受约束的LLM生成合成类型化补丁,并在提交前通过多维评分、符号护栏和金丝雀测试验证提议。每个接受的编辑都带有完整溯源和确定性回滚能力。在四个领域和27次多种子运行中,ANNEAL是唯一提交持久结构修复的评估系统——强基线如ReAct和Reflexion实现了高情境恢复,但在重复性故障上的保留失败率高达72-100%,而ANNEAL在测试的重复故障设置中将这一比率降至0%。消融实验证实,移除FDKA会消除所有结构修复,并将成功率降低多达26.7个百分点。这些结果表明,受控符号修复为持久故障消除提供了一种与权重级和提示级适配互补的范式。
查看缓存全文
缓存时间: 2026/05/19 06:34
# 通过受管控的符号补丁学习适配LLM智能体
实现:github.com/sbhakim/anneal-agents。来源:https://arxiv.org/html/2605.16309
## ANNEAL:通过受管控的符号补丁学习适配LLM智能体††感谢:实现代码:github\.com/sbhakim/anneal\-agents (https://github.com/sbhakim/anneal-agents)。Safayat Bin Hakim¹, Keyan Guo², Wenkai Tan¹, Alvaro Velasquez³, Shouhuai Xu⁴, Houbing Herbert Song¹
¹马里兰大学巴尔的摩郡分校,²布法罗大学,³科罗拉多大学博尔德分校,⁴科罗拉多大学科罗拉多斯普林斯分校
###### 摘要
基于LLM的智能体能够从单个执行错误中恢复,但当底层过程知识——操作符模式、前置条件和约束——未被修复时,它们会在同一故障上反复失败。现有的自进化方法通过更新提示、记忆或模型权重来解决这一问题,但没有一种方法直接修复编码任务执行方式的符号结构,而且很少有方法能提供安全部署所需的管控保障。我们提出Anneal,一种神经符号智能体,它将反复出现的失败转化为对过程知识图谱的受管控符号编辑,而无需修改基础模型权重。其核心机制——失败驱动的知识获取(FDKA)——定位负责的操作符,通过受约束的LLM生成合成一个类型化补丁,并在提交前通过多维评分、符号护栏和金丝雀测试验证该提案。每个被接受的编辑都带有完整的溯源和确定性回滚能力。在四个领域和27次多初始种子运行中,Anneal是唯一一个提交持久结构性修复的评估系统——ReAct和Reflexion等强基线实现了较高的回合恢复率,但在重复故障上仍保持72–100%的保留失败率,而Anneal在测试的重复失败设置中将此降低到0%。消融实验证实,移除FDKA会消除所有结构性修复,并将成功率降低多达26.7个百分点。这些结果表明,受管控的符号修复为持久消除故障提供了一种补充范式,区别于权重级和提示级适配。
## 1 引言
当人类专家遇到重复的过程故障——例如,一个预订系统在黑名单日期持续拒绝公司卡——他们不会简单地更努力地重试;他们会通过添加对封锁日期的检查来修复底层流程。这种将重复故障转化为持久结构性修复的能力是专业知识的核心(Belle et al., 2023 (https://arxiv.org/html/2605.16309#bib.bib1))。基于LLM的智能体缺乏这种能力:它们可能在单个情节内恢复,但当同一故障再次出现时,它们会再次失败,因为导致故障的过程知识——操作符模式、前置条件和约束——没有改变(Goel et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib2))。
最近关于自进化智能体的工作通过几种范式解决了这一差距。基于反思的方法在情节间存储语言摘要(Shinn et al., 2023 (https://arxiv.org/html/2605.16309#bib.bib3)),但保持智能体的操作知识不变;同一结构性故障可能在每个新任务上重复出现。记忆增强的方法检索过去的轨迹或提炼的原则来指导决策(Wu et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib4); Zhong et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib5)),然而它们适配的是智能体*回忆起*的内容,而不是*执行*的过程定义。基于记忆的强化学习(Zhang et al., 2026b (https://arxiv.org/html/2605.16309#bib.bib6))和进化提示优化(He et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib7); Zhang et al., 2026a (https://arxiv.org/html/2605.16309#bib.bib8))提供了更强的适配,但仍然是作用于提示、策略或权重——没有一种方法直接修复编码任务如何规划和执行的类型化符号结构。此外,这些系统中很少有提供安全部署所需的管控保证——溯源、护栏、金丝雀测试、回滚(Wan et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib9); Shao et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib10))。
在这项工作中,我们提出Anneal(图1 (https://arxiv.org/html/2605.16309#S1.F1)),一种神经符号智能体,通过将重复失败转化为对过程知识图谱的受管控符号编辑来弥合这一差距,而无需修改基础模型权重。Anneal不是更新智能体回忆起什么或如何提示,而是修复规划器直接咨询的操作符定义——确保一旦故障被修复,它就不能在结构上再次出现。其核心机制——失败驱动的知识获取(FDKA)——将LLM严格视为在封闭类型模式下的受约束代码生成器,因此所有接受逻辑保持符号化和可审计。由于没有单一的验证步骤足以确保安全部署,提议的编辑必须在提交前经过多维评分、义务/因果护栏和金丝雀测试——每一层捕获其他层遗漏的故障模式。元认知控制器通过基于不确定性和违规信号在快速路径和深思熟虑路径之间进行仲裁,进一步调节何时需要适配。目标环境和开放世界可指令性问题的形式化定义见附录A (https://arxiv.org/html/2605.16309#A1)。
请参见图注
图1:Anneal适配周期。用户请求酒店预订;执行因违反策略失败。FDKA定位负责的操作符,合成前置条件补丁,通过评分和护栏验证,并提交。使用更新后的操作符重新规划成功。完整周期:<2分钟,无需模型重训练。
**贡献。** 我们的工作将神经符号规划(Goel et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib2); Kwon et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib11))、元认知控制(Bergamaschi Ganapini et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib12); Ji-An et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib13))和因果/价值验证(Jaimini et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib14); Zi et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib15))集成到一个用于符号过程修复的受管控系统中。我们做出以下贡献:
1. **受管控的失败驱动知识获取。** 我们提出FDKA,一个在封闭JSON模式下合成类型化符号编辑(模式更新、前置条件添加、效果细化)并通过多维评分、价值/因果护栏和金丝雀部署进行验证的流水线。在报告的27次运行中,FDKA实现了100%的补丁接受率,且未观察到回滚(附录E (https://arxiv.org/html/2605.16309#A5), F (https://arxiv.org/html/2605.16309#A6))。
2. **元认知仲裁。** 一个阶段感知的控制循环监控不确定性和违规信号,以在显式预算下在快速(S1)、深思熟虑(S2)和验证-再行动路径之间进行仲裁。在随机噪声下,移除仲裁使成功率下降4.7个百分点,因为复合策略转移创建了超快速路径预算的多违规链。
3. **全面的管控覆盖。** 每个提交的编辑都带有溯源、Beta–Bernoulli信任评分、人在回路门控和确定性回滚。一个专门的管控压力基准确认了选择性激活:在报告套件中,所有六个对认证敏感的模式编辑在提交前都被升级,该基准上的决策准确率达到100%。
4. **跨四个领域的实证证据。** 在27次多初始种子运行中,Anneal是唯一一个提交持久结构性修复同时实现94.7–100%任务成功率的评估系统。在重复故障压力测试中,提交的补丁将评估设置中的保留故障降低到0%,而ReAct和Reflexion尽管实现了高回合恢复率,但仍保持72–100%的保留故障率。移除FDKA使成功率下降多达26.7个百分点,并消除了所有结构性修复(附录G (https://arxiv.org/html/2605.16309#A7)提供了TTA收敛界)。
第2节 (https://arxiv.org/html/2605.16309#S2)回顾相关工作;第3节 (https://arxiv.org/html/2605.16309#S3)形式化智能体和控制循环;第4节 (https://arxiv.org/html/2605.16309#S4)详细介绍FDKA和管控;第5节 (https://arxiv.org/html/2605.16309#S5)介绍评估;第6节 (https://arxiv.org/html/2605.16309#S6)讨论局限性。
## 2 相关工作
关于神经符号规划、元认知控制和符号知识编辑的额外背景见附录A (https://arxiv.org/html/2605.16309#A1);正文在此聚焦于最具新颖性的对比。
**自进化系统的管控。** 集成因果和价值推理对于安全自主性至关重要(Jaimini et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib14); Zi et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib15))。关于受管控部署的调查(Wan et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib9))强调溯源、人类监督和回滚是先决条件,而风险分析表明自进化可能通过记忆、工具、模型或工作流漂移降低安全性(Shao et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib10))。Anneal通过元认知仲裁、多维评分和一个显式的管控覆盖(溯源、信任、回滚)实例化了这一工作线。
**自进化智能体。** 调查通过进化什么、何时进化以及如何进化来组织自进化智能体(Gao et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib16))。当前方法涵盖:对持久化工件进行显式进化(Lin et al., 2026 (https://arxiv.org/html/2605.16309#bib.bib17))、测试时更新全智能体配置(He et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib7))、离线自蒸馏加在线策略强化(Wu et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib4))、轨迹级自我改进(Lin et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib18))、从经验中自主学习策略(Sun et al., 2025 (https://arxiv.org/html/2605.16309#bib.bib19)),以及记忆增强或基于强化学习的适配(Zhong et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib5); Zhang et al., 2026b (https://arxiv.org/html/2605.16309#bib.bib6); a (https://arxiv.org/html/2605.16309#bib.bib8))。这些系统主要进化提示、记忆、轨迹或策略。相比之下,Anneal针对的是类型化符号过程知识——操作符、前置条件、效果、工具模式和约束——并且只接受通过评分、护栏和金丝雀测试的受管控编辑(表1 (https://arxiv.org/html/2605.16309#S2.T1))。因此其贡献更窄但更具体:对过程知识的受管控、权重冻结的结构性修复,而不是对任意智能体组件的广泛自我进化。
邻近的模型编辑工作则改变内部模型参数或辅助记忆以改变行为,最近的结果突显了在可靠性、泛化性、局部性、能力保持和多次编辑下安全性之间的显著权衡(Li et al., 2024 (https://arxiv.org/html/2605.16309#bib.bib20); Wang et al., 2024a (https://arxiv.org/html/2605.16309#bib.bib21))。Anneal的不同之处在于编辑基础模型外部的显式符号过程知识,使得更改可以直接审计、可逆,并与管控约束兼容。
表1:代表性的自进化系统。Anneal在精神上与工件级进化最接近,但在类型化符号修复目标和更严格的受管控提交流程上有所不同。
下一节在详细阐述FDKA和管控(第4节 (https://arxiv.org/html/2605.16309#S4))之前,形式化Anneal的智能体元组和控制循环。
## 3 系统概述与控制
**智能体元组。** 设A = (Π, Σ, E, M, R),其中Π是咨询PKG的HTN规划器,Σ是类型化符号状态,E是执行器,M是元认知控制器,R = (R_rules, R_exp)包含*规则池*(操作符、约束)和*经验池*(索引化的失败轨迹)。目标环境和开放世界可指令性的形式化范围在附录A (https://arxiv.org/html/2605.16309#A1)中定义。在本文中,u表示不确定性,p_viol表示违规概率,B表示剩余预算,τ_u, τ_p表示它们各自的升级阈值。一个**操作符**是o = ⟨名称, 参数, pre(o), eff(o), cost(o)⟩。一个**补丁**Δo修改这些字段(通常是添加前置条件)。接受条件由下式管控:
a = 𝟙[ Score(Δo) ≥ θ ∧ Verify(Δo) = allow ], (1)
其中Score聚合了合理性、一致性、效用和风险(附录E (https://arxiv.org/html/2605.16309#A5));Verify强制价值和因果约束。被接受的补丁被暂存、进行金丝雀测试并提交,附带溯源;被拒绝的补丁被记录以用于审计。
请参见图注
图2:Anneal系统架构。指令通过过程知识图谱(PKG)编译成HTN计划。元认知控制器M监控不确定性u(令牌级熵)和违规概率p_viol(基于前置条件差距的Logistic启发式),以在S1(快速)、S2(深思熟虑)和Verify(前置条件检查)路径之间仲裁。失败触发FDKA:定位负责的操作符,合成补丁Δo,评分,通过护栏验证,并在管控下提交(溯源、信任、回滚)。
图2 (https://arxiv.org/html/2605.16309#S3.F2)展示了闭环架构。分离规划、接地、控制、适配、安全和学习的八个核心API在附录B (https://arxiv.org/html/2605.16309#A2)中列出。
**控制循环。** 在每个规划步骤,控制器计算(见附录C (https://arxiv.org/html/2605.16309#A3)获取信号计算细节):
pathway = Arb(u, p_viol, B) =
{ Verify if p_viol > τ_p ∧ B ≥ c_Verify
S_2 if u > τ_u ∧ B ≥ c_S_2
S_1 否则
} (2)
其中u ∈ [0,1]是不确定性(接地完备性代理),p_viol ∈ [0,1]是违规概率(前置条件差距启发式),B是剩余预算,c_S_1 < c_S_2 < c_Verify是路径成本。不确定性从规划接地期间的令牌级熵计算;违规概率从p_viol = σ(α·gap + β)计算,其中gap = max(0, `(所需前置条件)` - `(当前状态)`。当p_viol > τ_p时,验证器检查接下来h个操作符(h=3):
Verify(π, Σ, h) =
{ allow if ∀i ∈ [1,h]: Σ ⊧ pre(π_i)
repair if ∃i: Σ ⊭ pre(π_i) ∧ LocalFix
block 否则
} (3)
局部修复替换可信的替代操作符或应用来自R_exp的微补丁。相似文章
LANTERN:一种结合大语言模型增强、基于经验门控推理网络的神经符号迁移方法
本文介绍了 LANTERN,这是一个用于强化学习中多源神经符号迁移的框架,它利用大语言模型生成任务自动机,并结合自适应门控机制来提高样本效率。
SEAL: 智能体与学习环境的协同共演化
SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。
重新思考自进化大语言模型智能体的持续经验内化
本文研究了大语言模型智能体在多轮迭代经验内化过程中出现能力渐进式崩溃的原因,并提出了一套从经验粒度、注入模式和训练机制三个维度出发的鲁棒解决方案。主要发现包括:原则级经验、逐步注入方式以及离策略上下文蒸馏能够带来更稳定、更可持续的持续学习效果。
通过可扩展神经符号模型的生成式可解释性
本文主张从AI的事后可解释性向生成式可解释性范式转变,提出神经符号模型以实现人类可理解的检查点和因果干预,确保大型语言模型在代理系统中的安全部署。
ExpGraph:面向LLM智能体的模型无关经验学习与图结构记忆
ExpGraph是一个模型无关的框架,通过自进化的技能与失败经验图,使LLM智能体能够复用过往经验,在不重新训练执行器的情况下将任务性能提升12%-21%。