重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合

arXiv cs.AI 论文

摘要

本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。

arXiv:2607.26643v1 公告类型:新 摘要:使大语言模型(LLM)智能体能够从过去的交互中积累并复用经验,仍然是现实应用中的一个核心挑战。一种有前景的解决方案是将技能视为可训练状态,并如同神经网络训练中的模型参数一样对其进行优化。然而,数据驱动的技能优化容易对从真实环境中收集的有限轨迹产生过拟合。过度利用这些轨迹会对当前批次过拟合,而无约束的探索则会导致在先前已解决问题上的性能回退。这种紧张关系促使我们从受约束搜索的角度看待技能自我进化,并由探索-利用权衡所支配。我们提出了SkillBoost,一个三阶段框架,用以缓解这两种风险:结构化利用将观察到的失败定位到可编辑的技能组件上,先验引导的探索借助LLM中的先验知识生成多样的修复候选,而验证接受则在回归边界内仅当候选能提升性能时才予以采纳。在23个模型-基准配置上的实验表明,SkillBoost在缓解过拟合的同时达到了最先进的性能,优于人工编写的技能和LLM生成的技能。迁移实验进一步表明,优化后的技能可以被其他智能体在相似任务上复用。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:01

# 重新思考自我进化:一种缓解技能过拟合的约束探索-利用过程
来源:https://arxiv.org/abs/2607.26643
查看 PDF (https://arxiv.org/pdf/2607.26643)

> 摘要:让大型语言模型 \(LLM\) 智能体能够从过去的交互中积累并复用经验,仍然是实际应用中的核心挑战。一个有前景的解决方案是将技能视为可训练的状态,并像神经网络训练中的模型参数一样对其进行优化。然而,数据驱动的技能优化容易对从真实环境中收集的有限轨迹产生过拟合。过度利用这些轨迹会过拟合当前批次,而无约束的探索则会导致在先前已解决问题上出现性能回退。这种张力促使我们从受限搜索的视角看待技能自我进化,其核心是在探索与利用之间进行权衡。我们提出了 SkillBoost,一个三阶段框架,用以缓解这两种风险:结构化利用将观察到的失败定位到可编辑的技能组件上;先验引导的探索借助 LLM 中的先验知识生成多样化的修复候选;验证接受则仅当候选能在回退界限内提升性能时才予以采纳。在 23 组模型-基准配置上的实验表明,SkillBoost 在缓解过拟合的同时取得了最先进的性能,优于人工设计的技能和 LLM 生成的技能。迁移实验进一步表明,优化后的技能可被其他智能体在相似任务上复用。

## 提交历史

来自:Hongqiang Lin \[查看电子邮件 (https://arxiv.org/show-email/f92c40ed/2607.26643)\] **\[v1\]** 2026年7月29日星期三 09:05:40 UTC (663 KB)

相似文章

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

arXiv cs.AI

This paper introduces SkillMisevo-Gym and SkillMisevo-Bench to study how self-improving LLM agents can evolve unsafe skills from compromised experience, plus SafeEvolve as a mitigation wrapper. Experiments across 25 agent-method configurations show skill misevolution is widespread and can persist across sessions, though SafeEvolve reduces fresh-session harm significantly.

OpenSkill:LLM智能体的开放世界自进化

Hugging Face Daily Papers

OpenSkill是一个框架,让LLM智能体能够从开放世界资源中自进化技能和验证信号,无需目标任务监督,在多个基准测试中实现高性能。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化

Hugging Face Daily Papers

SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。