层级自改进:任务特定可演化代理执行框架
摘要
本文介绍了层级自改进(HSI),这是一个通过层级自修改演化任务特定执行框架来增强冻结LLM代理的框架,在中等难度任务上取得了显著提升,但受限于反馈质量和骨干模型能力。
查看缓存全文
缓存时间: 2026/08/21 16:11
论文页面 - 层级自我改进:任务特定可演进智能体执行框架
来源:https://huggingface.co/papers/2608.08466 发布于8月9日
·
提交者:https://huggingface.co/TalentZHOU
Tailin (https://huggingface.co/TalentZHOU) 于8月21日
摘要
层级自我改进通过层级式自修改机制,为冻结的大语言模型智能体演进任务特定的执行框架,在中等难度任务上取得显著提升,但其效果受反馈质量和主干模型能力的限制。
现代大语言模型智能体通常通过手动修改提示词、工具或工作流来改进,而模型周围的可执行脚手架——即执行框架——通常被视为部署后的固定构件。本研究探讨了一种替代方案:让执行框架具备任务特定性并可持续演进。每个任务族维护自身的执行框架,通过固定的任务注入接口进行迭代热切换,并利用环境反馈进行重写。我们提出层级自我改进框架,其中单一冻结的大语言模型M在三个层级范围内运作:执行任务的任务执行框架H、重写H的演进器,以及在冻结外锚点下重写演进器策略代码的元演进器。“思考开关”设计通过在任务执行时禁用推理、在自修改时启用推理,有效隔离了框架演进的贡献。层级自我改进受两个因素制约:反馈保真度界,因为演进需要信息丰富的奖励信号来指导选择;主干能力界,因为框架重构无法克服冻结模型的固有能力限制。在BALROG基准测试中,以DeepSeek-V4-Flash-Preview作为冻结主干,层级自我改进在中等难度任务上相比初始框架取得持续提升(BabyAI +39.3%、Crafter +33.0%、TextWorld +25.0%、MiniHack +15.0%,均为原始进度百分比),并在BabaIsAI子集上展现出强大的留出泛化能力(BreakStop最佳测试得分0.98,GoTo从20%未见数据划分中达到1.00)。在超出主干能力的任务上,框架演进未带来改进。这些结果表明,在明确的实证限制下,任务特定框架演进是改进冻结大语言模型智能体的可行路径。代码已开源:https://github.com/TailinZhou/hsi。
查看arXiv页面 (https://arxiv.org/abs/2608.08466) 查看PDF (https://arxiv.org/pdf/2608.08466) GitHub7 (https://github.com/TailinZhou/hsi) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08466)
在您的智能体中获取本文:
hf papers read 2608.08466
没有最新CLI?请运行:curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型
0
暂无模型链接本文
在模型README.md中引用 arxiv.org/abs/2608.08466 以从此页面链接。
引用本文的数据集
0
暂无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2608.08466 以从此页面链接。
引用本文的Spaces
0
暂无Space链接本文
在Space README.md中引用 arxiv.org/abs/2608.08466 以从此页面链接。
包含本文的收藏集
0
暂无收藏集包含本文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
@omarsar0: // 自我束具:能自我改进的束具 // (收藏这个)我们今天依赖的大多数智能体框架…
本文介绍了自我束具(Self-Harness),一种新的范式,其中基于LLM的智能体能够迭代地改进自身的操作束具——包括提示、工具和控制流程——无需人类工程师或更强大的外部智能体,在多个模型上取得了显著的性能提升。
HELIX:模型-工具链协同进化以实现递归自我改进
本文提出将模型-工具链协同进化作为AI代理递归自我改进的基本原则,并引入HELIX,一个可溯源的系统,通过生成验证轨迹的结构化训练信号来改进执行和学习。
Adaptive Auto-Harness: 在开放式任务流上实现智能体系统部署的持续自我改进
Adaptive Auto-Harness 是一个框架,用于在开放式任务流上部署的智能体系统的持续自我改进,通过状态性多智能体进化器、harness树和人工引导钩子超越基线。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
递归式 Harness 自我改进
介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。