COBRA-Skills:上下文赌博机引导的智能体技能优化进化
摘要
COBRA-Skills 提出了一种通过上下文赌博机和进化算子优化智能体技能的方法,在多个 AI 智能体基准测试中实现了 55-58% 的优化成本降低。
查看缓存全文
缓存时间: 2026/09/14 02:33
论文页面 - COBRA-Skills:基于上下文老虎机引导的智能体技能优化演进
来源:https://huggingface.co/papers/2609.11682
https://huggingface.co/papers/2609.11682#cobra-skills-contextual-bandits-for-efficient-agent-skill-optimization-%F0%9F%9A%80COBRA-Skills:高效智能体技能优化的上下文老虎机方法 🚀
如何在不反复对低效候选方案投入大量计算、或依赖高成本LLM精修的情况下,优化智能体技能?
COBRA-Skills将技能优化建模为序列化预算分配问题:
下一步最值得评估哪个技能?
COBRA-Skills不再通过穷举尝试和精修候选技能,而是维护一个技能种群,并采用:
- 神经网络预测器估算技能效用,
- 线性上下文老虎机平衡探索与利用,
- 目标智能体执行反馈更新老虎机状态,
- 计划性演化算子(再生、展开突变与交叉)驱动技能种群进化。
https://huggingface.co/papers/2609.11682#results实验结果
我们在6个多样化智能体基准测试 × 3个目标模型上评估了COBRA-Skills,涵盖搜索问答、电子表格、文档理解、数学推理、社会推理和具身任务。
COBRA-Skills实现:
- 🏆 在对比方法中取得最佳平均性能,
- 💰 相较SkillOpt降低约55–58%优化成本,
- 📊 每个基准测试仅需50个优化样本,
- 🔧 在Codex与Claude Code框架下均保持稳定有效性,
- 🤖 即使由目标模型自身生成与优化技能时仍表现优异。
一个有趣发现是,成本降低主要并非源于减少目标智能体执行次数,而是大量避免了重复的LLM轨迹分析与技能重写工作。
📄 论文:https://arxiv.org/abs/2609.11682 💻 代码:https://github.com/Jerry-LuP/COBRA-Skills
欢迎反馈与讨论!
相似文章
COBRA-Skills: 基于上下文赌博机的高效代理技能优化(开源)
本文介绍了 COBRA-Skills,这是一种利用上下文赌博机高效优化代理技能的方法,通过避免重复的基于 LLM 的轨迹分析和技能重写来降低成本。
SkillOpt:自我进化智能体技能的执行策略
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。
Bayesian-Agent:后验引导的LLM代理技能进化框架
Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。
SkillOpt-Lite: 通过一行指令实现更好更快的智能体自我进化
SkillOpt-Lite 提出了一种用于自主智能体技能优化的最小可行流水线,通过将所有组件视为可编辑代码并集成到生产编码智能体中,实现更好更快的自我进化。它通过零阶优化形式化技能优化,并在基准测试上优于先前方法。
重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合
本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。