CANTANTE:通过对比信用分配优化智能体系统 [R]

Reddit r/MachineLearning 论文

摘要

CANTANTE 引入了一种对比信用分配方法,通过将全局奖励分解为每个智能体的信号,优化多智能体 LLM 系统,从而实现自动化提示调优。在编程、数学和检索基准测试中,它超越了基线方法,在不增加推理成本的情况下实现了最高 +18.9 分的提升。

基于 LLM 的多智能体系统在复杂的现实任务中表现出了强大的性能,例如软件工程、预测建模和检索增强生成。然而,自动化其配置仍然是一个结构性挑战。研究人员常常被迫进行手动、试错式的提示调优,其中对单个智能体的修改会以难以追踪的方式改变全局输出。核心瓶颈在于**信用分配**:虽然控制智能体行为的参数是本地的,但性能得分仅在全局系统级别可用。这使得优化从根本上变得困难,因为我们无法固有地知道哪些智能体对结果产生了正面或负面的贡献。CANTANTE 试图走一条不同的路径:将智能体提示视为从任务奖励中学习的参数,而不是手工调优。通过解决信用分配问题,我们可以从脆弱的手工智能体演示转向真正自主且实用的可信系统。CANTANTE 的算法简要说明(见第二张图):1. 让本地优化器提出配置(例如提示)。2. 在相同查询上评估不同配置,捕获推理轨迹和系统得分。3. 让一个归因器比较这些运行,并为每个智能体分配信用,从而将全局奖励分解为每个智能体的更新信号。4. 将这些信用反馈给任何本地优化器;在实验中,我们使用了 CAPO,这是我们之前发表在 AutoML 2025 中的提示优化器。在与 DSPy-solutions 的 GEPA 和 MIPROv2 在 MBPP(编程基准)、GSM8K(数学推理基准)和 HotpotQA(检索基准)上的评估中,CANTANTE:• 获得了最佳平均排名,• 在 MBPP 上比最强基线高出 +18.9 分,在 GSM8K 上高出 +12.5 分,• 相比未优化的提示,保持了推理时间成本。🔗 论文链接:[https://arxiv.org/abs/2605.13295](https://arxiv.org/abs/2605.13295) 💻 仓库链接:[https://github.com/finitearth/cantante](https://github.com/finitearth/cantante) 如果您正在研究多智能体架构或自动提示工程,我很想了解目前对您来说什么有效(以及什么正在失效)。
查看原文

相似文章

TACO:面向智能体工具使用的工具增强信用优化

Hugging Face Daily Papers

TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。

通过反事实推理路径减少信用分配方差

arXiv cs.LG

提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。