MARS: 面向竞赛编程的多专家LLM中继系统
摘要
MARS是一个多智能体LLM框架,使用针对不同算法主题的专业智能体来解决竞赛编程问题,实现了0.624的通过率,成本更低且方差小于直接提示。
arXiv:2608.23918v1 公告类型:新
摘要:大型语言模型在代码生成方面表现出色,但竞赛编程暴露了一个持续的失败模式:现有的多智能体流程将工作分配给通用的规划者、编码者和调试者角色,并将算法技术的选择完全委托给主干模型。我们提出MARS(多专家LLM中继系统),一个仅提示框架,其中每个智能体都是一个主题专家——动态规划、图论、字符串、几何等——通过基于算法理论语料库的检索增强生成进行支撑。给定一个问题,检索选择一个相关的小专家团队;一个起始智能体编写初始的C++17解决方案,每个后续回合在沙箱中针对公开示例运行候选方案,让活跃的智能体保留、修复或交接草稿,并将结构化数据包转发给下一个智能体。最后,一次基础设施修复遍历会标准化样板代码。在使用Gemma 4的CodeContests测试集上,MARS达到了$0.624 \pm 0.006$的通过率,每个任务平均2.3个记录的管道阶段(比直接提示提高14.4个百分点),缩小了与CodeSIM($0.731$)的大部分差距,同时墙钟成本降低了3.3倍,且每个任务的令牌消耗方差显著减小。源代码可在GitHub上获取:https://github.com/fckand/mars。
查看缓存全文
缓存时间: 2026/08/26 09:17
# 面向竞赛编程的多专家LLM接力系统 来源:https://arxiv.org/html/2608.23918 ###### 摘要 大型语言模型在代码生成方面表现卓越,但竞赛编程场景揭示了一种持续存在的缺陷:现有的多智能体流程将工作分配给通用的规划者、编码者和调试者角色,并将算法技术的选择完全委托给主干模型。我们提出MARS(多专业LLM智能体接力系统),这是一个纯提示框架,其中每个智能体都是特定领域的专家——涵盖动态规划、图论、字符串处理、几何等——并通过基于算法理论语料库的检索增强生成技术实现领域锚定。给定一个问题后,检索模块会筛选出一小队相关专家;起始智能体编写初始C++17解决方案,后续每轮在沙箱中对公共样例运行当前方案,允许活跃专家保留、修复或交接草稿,并将结构化数据包传递给下一位专家。最后一轮基础设施修复器会统一处理模板代码。在CodeContests测试集上使用Gemma 4模型时,MARS达到0.624±0.006的通过率,平均每任务2.3个记录管道阶段(比直接提示提高14.4个百分点),接近CodeSIM(0.731)的性能水平,而实际计算时间成本降低3.3倍,且每任务token消耗的方差显著减小。源代码已开源于GitHub:https://github.com/fckand/mars。 ## 1 引言 多智能体LLM系统近年来成为处理复杂任务的热门解决方案,涵盖软件开发、数学推理乃至科学发现(Guo等, 2024;Tran等, 2025;Chen等, 2025a)。这类任务通常需要专业领域知识才能成功。例如,解决竞赛编程问题需要结合理论算法洞察和问题特定上下文,而高级数学推理任务则需融合推理能力和扎实的理论基础。现有方法普遍假设LLM的大规模预训练确保了其广泛的专业知识,并依赖大型专有预训练模型作为通用专家。这导致多智能体系统将智能体角色视为通用抽象,而非真实领域专业知识的载体。 在本研究中,我们提出了一个由领域专业化智能体自组织的团队框架,称为MARS——多专业LLM智能体接力系统——该多智能体框架采用检索增强生成技术赋能的专业智能体,专为解决竞赛编程问题而设计。竞赛编程已成为代码生成LLM的标准压力测试,因为任务要求在稀疏信号下进行精细实现和验证(Li等, 2022;Chen等, 2023a;Islam等, 2025)。此外,问题常混合多个理论领域以挑战算法知识。现有方法(Islam等, 2024;Islam等, 2025;Li等, 2026)将竞赛编程问题视为通用代码生成,应用规划者、编码者和调试者团队处理任务中的算法内容,期待主题能力从底层LLM中涌现。内容无关的管道无法提供正确解决方案所需的算法专业知识。 为解决这一差距,我们提出MARS(多专业LLM智能体接力系统),其中每个智能体都是专注于单一算法领域的领域专家,通过检索增强生成技术在算法理论语料库上进行锚定。给定问题时,所有可用智能体被问及两个问题:任务是否匹配其专业领域,以及该智能体是否能启动接力流程。随后组建一个由任务匹配智能体组成的小型团队。初始智能体生成候选解决方案(基于公共测试执行结果进行迭代优化),并从团队中选择下一位贡献智能体。当智能体判断解决方案完成时,接力终止。 我们提出MARS这一主题对齐的多智能体接力系统,其中每个智能体都是通过算法理论语料库检索增强生成技术赋能的单领域专家,取代了阶段对齐的规划者-编码者-调试者分工。我们将公共测试执行作为每个接力步骤的环内信号:同一位专家在保留、修复或交接草稿前都会查看其执行报告。在CodeContests数据集上使用Gemma 4时,MARS达到0.624±0.006的通过率(平均每任务2.3个记录管道阶段),相比直接提示提升14.4个百分点,以3.3倍更低的实时计算成本和约7倍更小的每任务token消耗标准差,接近了CodeSIM(0.731)的性能水平。 ## 2 相关研究 异构多智能体LLM系统已在骨干模型多样性(Ye等, 2025)、去中心化协调(Yang等, 2025)以及从共享池动态组队(Yun等, 2026;Chen等, 2025b)等方向展开研究。另一条并行路径为智能体赋予人格或专业异构性:基于初始化提示的角色扮演(Li等, 2023)、用于临床推理的医学专科(Tang等, 2024)、数学领域的思考者/评判者/执行者角色(Lei等, 2024)以及堆叠式异构LLM层(Wang等, 2024)。这些系统中,异构性通过人格、骨干多样性、演化图连接或通用能力描述实现,但均未将智能体专业化与任务的主题结构耦合,也未基于主题知识库锚定专家——这正是MARS旨在填补的空白。 多项研究采用检索机制提升代码生成准确率:REDCODER(Parvez等, 2021)从数据库检索相关代码或摘要并提供给生成器;DocPrompting(Zhou等, 2023)根据自然语言意图检索库文档;RepoCoder(Zhang等, 2023)将任务提供的仓库作为检索数据库进行仓库级代码补全;近期,Wang等(2025a)从演化代码库检索上下文以合成测试并检测错误。这些均针对代码、API文档或代码库本身进行检索。而MARS针对不同算法理论主题进行检索——每个智能体对应一个语料库切片——瞄准竞赛任务所需的算法专业知识而非实现表面。 一旦智能体实现异构化,团队便不再固定。大量研究在推理时动态组建团队:根据任务描述招募专家(Chen等, 2023b)、从任务规范即时生成智能体和计划(Chen等, 2024)、通过无监督重要性评分排序候选方案(Liu等, 2023),或在LLM操作图中联合优化节点提示与智能体间边(Zhuge等, 2024)。MARS则通过自报主题能力组织团队:每位专家判断问题是否在其专业范围内,匹配的专家组队完成任务。 代码生成领域的进展主要来自将强大基础模型与外部循环(搜索、验证或修复输出)相结合:基于执行的评估(Chen等, 2021)、执行测试用例(Chen等, 2023a)、执行锚定调试(Chen等, 2023c)、迭代自反馈(Madaan等, 2023)及基于历史试验的言语强化(Shinn等, 2023);另一互补路径对齐嘈杂众包人类反馈以实现基于强化学习的代码生成(Wong和Tan, 2024)。而MARS保持纯提示方式,从确定性公共测试执行中获取反馈。 竞赛编程是该范式的核心压力测试,因其问题结合了稀疏正确性信号与深度算法内容:AlphaCode(Li等, 2022)仅通过大规模采样与强过滤才达到竞赛水平,后续基准测试显示即使强大模型也只能解决少量奥林匹克问题,最困难层级仍未攻克(Jain等, 2024;Shi等, 2024)。针对代码生成的多智能体方法通过将任务分解为角色来应对挑战:AgentCoder(Huang等, 2024)将程序员与测试设计者、测试执行者耦合,三者基于反馈迭代;MapCoder(Islam等, 2024)将检索、规划、编码和调试智能体串联为面向竞赛问题解决的流水线;CodeSIM(Islam等, 2025)在此基础上引入模拟驱动的规划与调试;Solvita(Li等, 2026)为相同场景开发了相关多智能体分解方案。 ## 3 方法 图1总结了MARS框架。从十一个主题专家智能体池中,通过检索增强生成技术锚定的自评估机制,筛选出至多三名智能体组成接力团队,共同传递单一C++17程序的解决方案。完整提示模板和端到端示例见附录A和B;附录C提供MARS及所有基线的伪代码。 每位专家通过主题描述和标签集标识,并根据其标签过滤的公共算法库语料进行自评估。评估返回领域内标志、相关性标志和置信度评分。我们根据评分筛选最多三名匹配专家,并通过单独的启动探测选择起始者。 每轮执行两次LLM调用。第一次调用基于当前代码、分配的子任务、起始者契约、前序接力状态摘要和检索的RAG上下文生成草稿。草稿在ExecEval(Khan等, 2023)中针对公共样例执行。第二次调用根据执行报告返回三种操作之一:保留代码、修复代码或无变更,并附带结构化交接字段。修复候选方案会重新运行公共样例测试,仅当其能编译且通过公共测试数量不低于当前轮次草稿时才被接受;否则修复被拒绝并恢复草稿。该确定性本地门控使用可观测执行信号而非自报置信度来控制保留/修复决策——置信度评分仅在团队选择阶段生效。 接力过程限制最多三名独特专家和八个步骤,在以下情况停止:收到显式停止信号、无未使用选定专家、达到步数预算,或连续两次无进展时重新路由并在第三次停止。接力结束后代码被清理,仅当检测到模板级故障(I/O连接、包含语句、类型宽度)时才调用基础设施修复器。 我们在CodeContests测试集(Li等, 2022)的165个任务上进行评估。骨干模型为指令微调版Gemma 4(Gemma Team, Google DeepMind, 2026),温度0.0,top-p值0.95,token预算4096。检索使用经Jina Embeddings v2编码的cp-algorithms语料库。所有对比系统均采用Gemma 4、温度0.0和4096 token预算。MARS、并行集成、基础接力和CodeSIM使用top-p值0.95;记录中的直接提示和单RAG运行使用值1.0。迁移运行遵循其记录的模型及方法特定设置(附录F)。直接提示使用单次调用;单RAG使用最高检索专家;并行集成合并专家候选方案;基础接力省略公共测试自检、子任务跟踪和基础设施修复器。 我们基于相同165个任务调整CodeSIM的开源框架。其发布的GPT-4结果使用156任务子集(Islam等, 2024;Islam等, 2025),无法直接比较。 ## 4 结果 ### 4.1 主要结果 表1总结了主要结果。MARS达到0.624±0.006的通过率(平均每任务2.3个记录管道阶段),相比直接提示(+0.144)、单RAG(+0.095)和并行集成基线(+0.060)均有提升。CodeSIM达到0.731±0.009;我们的方法在简化协议下缩小了该差距,并在每位专家轮次提供执行反馈。 在纯提示基线中,单RAG停滞于0.529,因为无测试信号的单专家无法从算法错误中恢复;并行集成每任务耗时360.9秒,候选方案仅在合并时协调。MARS通过引入步骤级公共测试反馈,在困难任务上建立+0.14的优势(图3),而纯提示基线在该类任务上徘徊于0.18–0.26。CodeSIM仍通过每困难任务最多45次调试迭代保持各层级领先,但MARS通过路由到主题专家而非重新规划通用智能体,以3.3倍更低的实时计算成本缩小了大部分差距。 表1:主要结果。通过率为已解决任务比例。时间以秒计,token以千为单位,调用次数为每任务统计。所有值为3次运行平均值。CodeSIM*为我们在Gemma4上的重跑结果。
相似文章
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
LEAP:利用代理框架增强LLMs在形式数学中的能力
LEAP是一种代理框架,使通用LLMs能够在Lean中实现形式定理证明的最新性能,解决了2025年普特南竞赛的全部12个问题,并在新基准(Lean-IMO-Bench)上将形式化证明率从低于10%提升至70%,超越了专门系统。
COOPA:一种面向运筹学问题的模块化LLM智能体架构
本文介绍了COOPA,一种面向运筹学问题的模块化LLM智能体架构,它结合了基于迭代置信度的建模、元素级溯源和多求解器路由。在八个LLM主干网络和四个基线的评估中,COOPA在六个主干网络上取得了最佳的宏平均准确率,并在最强基线的基础上提升了最多6.7个百分点。
当大型语言模型发展语言:用于高效多智能体推理的符号通信
本文提出通信语言符号路由(CLSR),多个LLM智能体自主发明并演化紧凑的符号语言进行推理,相比思维链(CoT)实现3-6倍的令牌减少,同时保持准确性。
@rohanpaul_ai: 斯坦福新论文指出,在同等推理预算下,单个LLM通常比多个……更好地解决多跳问题
一项新的斯坦福论文显示,在同等推理token预算下,单个LLM在多跳推理任务上通常优于多智能体系统,而多智能体设置带来的提升往往来自更多计算而非架构优势。该论文利用数据处理不等式解释为什么交接中的信息丢失会损害多智能体性能,并指出上下文质量是多智能体系统能够提供益处的关键因素。