标签
KernelZero提出了一种协同进化框架,利用Proposer和Coder模型提升GPU内核生成能力,在CUDA和Triton基准测试中表现出色。
MACE是一种用于基于LLM的多智能体系统的记忆-智能体协同进化框架,它利用自适应记忆图组织功能记忆单元,并通过执行反馈进行自适应,从而相比基线提升任务性能。
这项研究探讨了将框架进化与模型适应相结合用于AI代理,发现直接模仿专家会损害较弱模型的性能,并提出了一种基于策略的纠正方法,以在不破坏框架适应企业任务的情况下提高性能。
J-Zero是一个从零数据共同进化挑战者、求解者和评判者模型的统一框架,使语言模型能够在可验证和不可验证领域实现自我改进,性能超越基线。
EnvHarness 引入了一个可编程层,用于动态重塑静态环境以进行强化学习,通过 EnvRigger 自动针对弱点来提升智能体性能。
本文提出将模型-工具链协同进化作为AI代理递归自我改进的基本原则,并引入HELIX,一个可溯源的系统,通过生成验证轨迹的结构化训练信号来改进执行和学习。
研究人员提出了Red Queen Gödel Machine,这是一种用于自我改进AI的框架,其中代理和评估者共同演化以克服评估上限,在科学论文写作和评分等任务中展示了性能提升。
本文介绍了PIAC,一种通过使用潜在增益度量(无需参考解)并利用LLM生成多样化的实例变异器,来改进基于LLM的并行算法组合自动构建的框架。在TSP和CVRP上,它持续优于现有的LLM-ACP基线,实现了最高19.76%的相对改进。
一篇综述论文,提出了智能体系统中协同进化的三阶段分类法,涵盖智能体-智能体、智能体-环境以及元协同进化,以实现超越固定人工设计路径的开放式改进。
This paper proposes scaffold-mediated post-training, a paradigm where procedural scaffolds co-evolve with LLM parameters through discovery, distillation, and dynamic recompilation. On FeatureBench, automatically discovered skills improve pass rate by 8.1pp, with a 27.7% pass rate after distillation.
本文介绍了CoCoEvolve,一种自监督方法,通过在表示之间强制实现一一对应的一致性,提升跨图表、表格和代码的跨表示理解,并具有训练时和测试时的协同演化目标。
Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。
介绍了DecoEvo,一种用于文本空间中LLM优化的分数解耦协同进化方法,无需黄金评分标准即可同时提升求解器和评分器生成技能,在五个基准测试中相比基线实现了2.8%–5.0%的相对提升。
EvoSQL是一个面向Text-to-SQL的协同进化框架,通过带有情景记忆的生成器-评论器对迭代改进SQL生成,在Spider和BIRD基准测试上取得了性能提升。
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
MSCE是一种免训练框架,将LLM智能体的经验组织为三个记忆层次,并将其转化为带有证据链接的可复用技能,优于现有的记忆增强和技能增强基线。
介绍EvolvingWorld,这是一个用于互动文学世界中角色扮演智能体与世界模型共同演化的开放模式框架与基准,支持具有持久角色和世界状态更新的长时程模拟。
本文提出了一种在自我改进的大语言模型代理系统中协同进化评估指标和技能的方法,展示了指标是可以进化的,并且协同进化方法在代码生成、文本到SQL和报告生成任务中恢复了大部分由真实标签驱动的性能。
HASE 是一个强化学习框架,它在统一的智能体过程中协同进化模型权重、任务解决方案以及流程组件(引导与评估),使单个8B参数的模型在文本分类和阿尔法因子挖掘任务上能够匹配更大系统的性能。
红皇后哥德尔机器通过共同进化智能体和评估器,实现AI的递归自我改进,用更少的token达到更好的编码性能。