COBRA-Skills:上下文赌博机引导的智能体技能优化进化

Hugging Face Daily Papers 论文

摘要

COBRA-Skills 提出了一种通过上下文赌博机和进化算子优化智能体技能的方法,在多个 AI 智能体基准测试中实现了 55-58% 的优化成本降低。

大型语言模型(LLM)智能体可以从先前任务经验中提炼的可重用技能中受益,但现有的技能优化方法往往依赖于昂贵的基于执行的评估和大量的任务数据。我们引入 COBRA-Skills,一个高效的框架,将技能优化形式化为在动态演化候选空间上的预算顺序优化。COBRA-Skills 将上下文赌博机引导的优先排序与基于证据的技能进化相结合,选择性地将评估分配给有前途或信息丰富的候选技能,同时根据执行反馈不断优化技能种群。在六个异构智能体基准测试和三个目标模型中,COBRA-Skills 在比较方法中始终实现了最强的平均性能,同时将优化成本相对于 SkillOpt 降低了 55--58\%,并且每个基准测试仅使用 50 个独特的优化示例。进一步的分析表明,COBRA-Skills 对智能体框架的变化保持稳健,并且当目标模型本身用于技能生成和优化时,它也能有效执行。
查看原文
查看缓存全文

缓存时间: 2026/09/14 02:33

论文页面 - COBRA-Skills:基于上下文老虎机引导的智能体技能优化演进

来源:https://huggingface.co/papers/2609.11682

https://huggingface.co/papers/2609.11682#cobra-skills-contextual-bandits-for-efficient-agent-skill-optimization-%F0%9F%9A%80COBRA-Skills:高效智能体技能优化的上下文老虎机方法 🚀

如何在不反复对低效候选方案投入大量计算、或依赖高成本LLM精修的情况下,优化智能体技能?

COBRA-Skills将技能优化建模为序列化预算分配问题:

下一步最值得评估哪个技能?

COBRA-Skills不再通过穷举尝试和精修候选技能,而是维护一个技能种群,并采用:

  • 神经网络预测器估算技能效用,
  • 线性上下文老虎机平衡探索与利用,
  • 目标智能体执行反馈更新老虎机状态,
  • 计划性演化算子(再生、展开突变与交叉)驱动技能种群进化。

https://huggingface.co/papers/2609.11682#results实验结果

我们在6个多样化智能体基准测试 × 3个目标模型上评估了COBRA-Skills,涵盖搜索问答、电子表格、文档理解、数学推理、社会推理和具身任务。

COBRA-Skills实现:

  • 🏆 在对比方法中取得最佳平均性能,
  • 💰 相较SkillOpt降低约55–58%优化成本
  • 📊 每个基准测试仅需50个优化样本
  • 🔧 在Codex与Claude Code框架下均保持稳定有效性,
  • 🤖 即使由目标模型自身生成与优化技能时仍表现优异。

一个有趣发现是,成本降低主要并非源于减少目标智能体执行次数,而是大量避免了重复的LLM轨迹分析与技能重写工作。

📄 论文:https://arxiv.org/abs/2609.11682 💻 代码:https://github.com/Jerry-LuP/COBRA-Skills

欢迎反馈与讨论!

相似文章

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

Bayesian-Agent:后验引导的LLM代理技能进化框架

Hugging Face Daily Papers

Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。

SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化

Hugging Face Daily Papers

SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。