层级自改进:任务特定可演化代理执行框架

Hugging Face Daily Papers 论文

摘要

本文介绍了层级自改进(HSI),这是一个通过层级自修改演化任务特定执行框架来增强冻结LLM代理的框架,在中等难度任务上取得了显著提升,但受限于反馈质量和骨干模型能力。

现代LLM代理通常通过手动修改提示、工具或工作流来改进,而模型周围的可执行脚手架——执行框架——在部署后通常被视为固定构件。本工作研究了一种替代方案,其中执行框架是任务特定的且持续可演化的:每个任务族维护自己的执行框架,通过固定的任务注入接缝在迭代间热交换,并使用环境反馈重写。我们介绍了层级自改进(HSI),这是一个框架,其中单个冻结LLM M在三个层级范围内运行:执行任务的任务执行框架H、重写H的演化器,以及在冻结外部锚点下重写演化器策略代码的元演化器。一个思考开关设计通过在任务执行期间禁用推理而在自修改期间启用推理,从而隔离执行框架演化的贡献。HSI受限于两个因素:反馈保真度界限,因为演化需要信息丰富的奖励信号来指导选择;以及骨干能力界限,因为执行框架重设计无法克服冻结模型的限制。在BALROG上以DeepSeek-V4-Flash-Preview作为冻结骨干,HSI在中等难度任务上相对于初始执行框架取得了持续增益(在BabyAI上+39.3,在Crafter上+33.0,在TextWorld上+25.0,在MiniHack上+15.0,所有均为原始\%进度),同时在BabaIsAI子套件上获得了强大的留外泛化能力(从20%未见划分中,在BreakStop上最佳测试为0.98,在GoTo上为1.00)。在超出骨干能力的任务(NLE)上,执行框架演化没有提供改进。这些结果证明,在明确的经验限制下,任务特定的执行框架演化是改进冻结LLM代理的可行轴。代码可在https://github.com/TailinZhou/hsi获取。
查看原文
查看缓存全文

缓存时间: 2026/08/21 16:11

论文页面 - 层级自我改进:任务特定可演进智能体执行框架

来源:https://huggingface.co/papers/2608.08466 发布于8月9日

·

提交者:https://huggingface.co/TalentZHOU

Tailin (https://huggingface.co/TalentZHOU) 于8月21日

摘要

层级自我改进通过层级式自修改机制,为冻结的大语言模型智能体演进任务特定的执行框架,在中等难度任务上取得显著提升,但其效果受反馈质量和主干模型能力的限制。

现代大语言模型智能体通常通过手动修改提示词、工具或工作流来改进,而模型周围的可执行脚手架——即执行框架——通常被视为部署后的固定构件。本研究探讨了一种替代方案:让执行框架具备任务特定性并可持续演进。每个任务族维护自身的执行框架,通过固定的任务注入接口进行迭代热切换,并利用环境反馈进行重写。我们提出层级自我改进框架,其中单一冻结的大语言模型M在三个层级范围内运作:执行任务的任务执行框架H、重写H的演进器,以及在冻结外锚点下重写演进器策略代码的元演进器。“思考开关”设计通过在任务执行时禁用推理、在自修改时启用推理,有效隔离了框架演进的贡献。层级自我改进受两个因素制约:反馈保真度界,因为演进需要信息丰富的奖励信号来指导选择;主干能力界,因为框架重构无法克服冻结模型的固有能力限制。在BALROG基准测试中,以DeepSeek-V4-Flash-Preview作为冻结主干,层级自我改进在中等难度任务上相比初始框架取得持续提升(BabyAI +39.3%、Crafter +33.0%、TextWorld +25.0%、MiniHack +15.0%,均为原始进度百分比),并在BabaIsAI子集上展现出强大的留出泛化能力(BreakStop最佳测试得分0.98,GoTo从20%未见数据划分中达到1.00)。在超出主干能力的任务上,框架演进未带来改进。这些结果表明,在明确的实证限制下,任务特定框架演进是改进冻结大语言模型智能体的可行路径。代码已开源:https://github.com/TailinZhou/hsi。

查看arXiv页面 (https://arxiv.org/abs/2608.08466) 查看PDF (https://arxiv.org/pdf/2608.08466) GitHub7 (https://github.com/TailinZhou/hsi) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08466)

在您的智能体中获取本文:

hf papers read 2608.08466

没有最新CLI?请运行:curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型

0

暂无模型链接本文

在模型README.md中引用 arxiv.org/abs/2608.08466 以从此页面链接。

引用本文的数据集

0

暂无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2608.08466 以从此页面链接。

引用本文的Spaces

0

暂无Space链接本文

在Space README.md中引用 arxiv.org/abs/2608.08466 以从此页面链接。

包含本文的收藏集

0

暂无收藏集包含本文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

递归式 Harness 自我改进

arXiv cs.AI

介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。