标签
MOAE 提出了一种帕累托保留的进化搜索方法,能够在搜索过程中无需固定标量化,同时优化 LLM 代理的多个目标,包括任务性能、轨迹质量和安全性。
本文综述将自我演化LLM智能体与动态图变换联系起来,提出一个框架将智能体状态建模为动态图,并组织现有方法以促进其演化。
本文介绍了潜在同策略自蒸馏(LOPD),该方法使教师的特权上下文能够从经验中端到端学习,提供密集的token级别监督,以提升智能体在智能工具使用和代码生成中的性能和效率。
本文提出混合开放式三方进化(HOTE)框架,该框架使用混合模式强化学习协同进化提议者、求解者和评判者,用于深度研究任务,以8B模型实现了超越更大静态模型的最优结果。
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
EvoMap 推出了 GEP(基因组进化协议),这是一种网络协议,使代理能够将成功策略转化为基因和胶囊以实现自我进化,减少重复探索。
awesome-autoresearch 列表更新,新增 6 个基于 Karpathy autoresearch 模式的应用案例,涵盖客服 agent 自我进化、Shell 集成、代码配置自我优化、RAG 调优和 ASO 等场景。