Solvita:通过智能体进化增强大型语言模型在竞赛编程中的能力

Hugging Face Daily Papers 论文

摘要

Solvita是一个智能体进化框架,通过强化学习更新图结构知识网络,实现代码生成中的持续学习,在竞赛编程基准测试中达到了最先进的性能。

大型语言模型(LLM)在处理高难度竞赛编程所需的严谨推理方面仍然存在困难。尽管最近的多智能体框架试图弥合这一可靠性差距,但它们本质上仍然是无状态的:它们依赖于静态检索,并丢弃了从先前任务中获得的有价值的问题解决和调试经验。为了解决这个问题,我们提出了Solvita,一个智能体进化框架,能够在不需要更新底层LLM权重的情况下实现持续学习。Solvita将问题解决重新组织为一个闭环系统,包括策略选择、程序合成、认证监督和针对性攻破,由四个专门智能体执行:规划器(Planner)、求解器(Solver)、预言机(Oracle)和黑客(Hacker)。关键在于,每个智能体都配有一个可训练的图结构知识网络。随着系统的运行,结果信号(例如通过/失败判定、测试认证质量以及由Hacker发现的对抗性漏洞)被转化为这些网络权重的强化学习更新。这使得智能体能够根据过去的成功和失败动态路由未来的查询,从而随时间积累可迁移的推理经验。在CodeContests、APPS、AetherCode和实时Codeforces回合上的评估表明,Solvita在代码生成智能体中达到了新的最先进水平,优于现有的多智能体流程,并将单次通过基线的准确性几乎翻倍。
查看原文
查看缓存全文

缓存时间: 2026/05/18 02:23

论文页面 - Solvita: 通过智能体进化增强大型语言模型的竞技编程能力

来源:https://huggingface.co/papers/2605.15301 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

Solvita 是一个智能体进化框架,通过强化学习更新图结构知识网络,实现代码生成中的持续学习,在竞技编程基准上达到最先进性能。

大型语言模型(Large language models,LLMs)在应对高难度竞技编程所需的严格推理时仍显吃力。尽管近期多智能体框架(multi-agent frameworks)试图弥合这一可靠性差距,但它们本质上仍是无状态的:依赖静态检索,并且丢弃了从先前任务中获得的宝贵问题解决与调试经验。为解决这一问题,我们提出了 Solvita,一个无需对底层 LLM 进行权重更新即可实现持续学习(continuous learning)的智能体进化框架。Solvita 将问题解决重构为一个闭环系统,涵盖策略选择、程序合成(program synthesis)、认证监督(certified supervision)和针对性攻击(targeted hacking),由四个专用智能体执行:Planner、Solver、Oracle 和 Hacker。关键在于,每个智能体都配有一个可训练的图结构知识网络。当系统运行时,结果信号(如通过/失败判定、测试认证质量、以及 Hacker 发现的对抗性漏洞)被转化为对这些网络权重的强化学习(reinforcement learning)更新。这使得智能体能够根据过去的成功与失败动态路由未来的查询,从而随时间积累可迁移的推理经验。在 CodeContests、APPS、AetherCode 以及实时 Codeforces 轮次上的评估表明,Solvita 在代码生成智能体中确立了新的最先进水平,超越了现有的多智能体流水线,并将单次基线方法的准确率几乎翻倍。

查看 arXiv 页面(https://arxiv.org/abs/2605.15301)查看 PDF(https://arxiv.org/pdf/2605.15301)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15301)

在你的智能体中获取此论文:

hf papers read 2605\.15301

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.15301 以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.15301 以从此页面链接。

引用此论文的 Space0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.15301 以从此页面链接。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

通过大型模型的演化

OpenAI Blog

本论文证明了在代码上训练的大型语言模型可以显著增强遗传编程的变异算子,使得能够在 Sodarace 领域中生成数十万个功能性 Python 程序用于机器人设计,且无需预训练数据。该方法称为演化通过大型模型(ELM),将 LLM 与 MAP-Elites 相结合,为上下文特定的制品生成引导新的条件模型。

@qinzytech: https://x.com/qinzytech/status/2066585405479371092

X AI KOLs Timeline

对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。

PACE: 双时间尺度自进化小语言模型智能体

arXiv cs.LG

PACE 提出了一种双时间尺度框架,用于小语言模型智能体的自进化,协调低风险的提示精炼与高风险的控制器逻辑更新,在多个基准上实现了高达 +9.2% 的相对提升。