Solvita:通过智能体进化增强大型语言模型在竞赛编程中的能力
摘要
Solvita是一个智能体进化框架,通过强化学习更新图结构知识网络,实现代码生成中的持续学习,在竞赛编程基准测试中达到了最先进的性能。
查看缓存全文
缓存时间: 2026/05/18 02:23
论文页面 - Solvita: 通过智能体进化增强大型语言模型的竞技编程能力
来源:https://huggingface.co/papers/2605.15301 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
Solvita 是一个智能体进化框架,通过强化学习更新图结构知识网络,实现代码生成中的持续学习,在竞技编程基准上达到最先进性能。
大型语言模型(Large language models,LLMs)在应对高难度竞技编程所需的严格推理时仍显吃力。尽管近期多智能体框架(multi-agent frameworks)试图弥合这一可靠性差距,但它们本质上仍是无状态的:依赖静态检索,并且丢弃了从先前任务中获得的宝贵问题解决与调试经验。为解决这一问题,我们提出了 Solvita,一个无需对底层 LLM 进行权重更新即可实现持续学习(continuous learning)的智能体进化框架。Solvita 将问题解决重构为一个闭环系统,涵盖策略选择、程序合成(program synthesis)、认证监督(certified supervision)和针对性攻击(targeted hacking),由四个专用智能体执行:Planner、Solver、Oracle 和 Hacker。关键在于,每个智能体都配有一个可训练的图结构知识网络。当系统运行时,结果信号(如通过/失败判定、测试认证质量、以及 Hacker 发现的对抗性漏洞)被转化为对这些网络权重的强化学习(reinforcement learning)更新。这使得智能体能够根据过去的成功与失败动态路由未来的查询,从而随时间积累可迁移的推理经验。在 CodeContests、APPS、AetherCode 以及实时 Codeforces 轮次上的评估表明,Solvita 在代码生成智能体中确立了新的最先进水平,超越了现有的多智能体流水线,并将单次基线方法的准确率几乎翻倍。
查看 arXiv 页面(https://arxiv.org/abs/2605.15301)查看 PDF(https://arxiv.org/pdf/2605.15301)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15301)
在你的智能体中获取此论文:
hf papers read 2605\.15301
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.15301 以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.15301 以从此页面链接。
引用此论文的 Space0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.15301 以从此页面链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
@rohanpaul_ai: 更好的自我改进智能体需要更好的求解器,而非更大的更新编写模型。这挑战了常见的习惯……
本文厘清了自我改进的LLM智能体中进化器与智能体的角色,表明一个小型进化器可以编写足够好的更新,而中端智能体最能从中受益。论文建议将最强的模型用作任务执行器,而非更新编写器。
通过大型模型的演化
本论文证明了在代码上训练的大型语言模型可以显著增强遗传编程的变异算子,使得能够在 Sodarace 领域中生成数十万个功能性 Python 程序用于机器人设计,且无需预训练数据。该方法称为演化通过大型模型(ELM),将 LLM 与 MAP-Elites 相结合,为上下文特定的制品生成引导新的条件模型。
@qinzytech: https://x.com/qinzytech/status/2066585405479371092
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。
PACE: 双时间尺度自进化小语言模型智能体
PACE 提出了一种双时间尺度框架,用于小语言模型智能体的自进化,协调低风险的提示精炼与高风险的控制器逻辑更新,在多个基准上实现了高达 +9.2% 的相对提升。
EvoOptiGraph:基于图结构生成的弱点驱动共同进化方法用于优化建模
EvoOptiGraph是一个框架,用于从自然语言自动进行优化建模,使用基于图的进化生成来创建多样化的训练数据,并通过弱点驱动的强化学习共同进化模型,在多个基准测试上取得了最先进的结果。