SBCO:面向规划智能体的自监督、基于验证器的框架优化

arXiv cs.AI 论文

摘要

介绍了SBCO,一种面向规划智能体的自监督、基于验证器的框架优化器,它通过近似块坐标上升法改进智能体输出,以远少于自修改基线的计算量达到或超越其性能。

arXiv:2608.10157v1 公告类型:新 摘要:自我改进智能体旨在通过使其能够随着时间推移不断进化并自我改进性能,来减少AI系统背后的人力工程投入。最近,人们提出了类似Darwin Gödel Machine和Huxley Gödel Machine的方法,这些方法通过自我参照实现开放式、递归的自我改进,即编码智能体编辑自己的代码。这种自我参照的自我改进方法要求执行任务所需的能力与自我修改所需的能力相一致或高度契合,编码任务正是如此。对于不满足所需对齐要求的领域或任务,自我参照式自我改进不可行。在这种情况下,可以通过去除自我参照方面,或引入元智能体的显式自我修改,将上述算法适配到其他任务——但两种方式都计算代价高昂,因为它们依赖于对大量候选智能体进行群体搜索或自我修改搜索。对于具有显式约束的规划任务,我们提出了一种便宜得多的替代方案。我们提出了SBCO(自监督块坐标优化器,Self-supervised Block Coordinate Optimizer),它是一种基于验证器的框架优化器,与Gödel机器方法同属闭环、从经验中改进的家族,但它是自监督的,而非自我参照的。给定一个智能体框架,SBCO通过近似块坐标上升学习一个分解的验证器库和一个框架策略,利用智能体自身的分级反馈来改进其输出——整个过程使用固定的元智能体,且无需人工标注。在两个领域中,SBCO达到或超越了一个定制化的自修改基线,同时使用的计算预算减少了4至5.5倍。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:21

# 面向规划智能体的自监督、基于验证器的框架优化

###### 摘要

自我改进型智能体旨在通过让系统随时间演化并自我提升其性能,来减少 AI 系统背后的人力工程。最近,诸如 Darwin Gödel Machine 和 Huxley Gödel Machine 等方法被提出,它们通过自我引用实现开放式、递归

相似文章

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

Bayesian-Agent:后验引导的LLM代理技能进化框架

Hugging Face Daily Papers

Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。