SoL-Pi:递归扩展自动研究循环以实现高效代理框架

Hugging Face Daily Papers 论文

摘要

SoL-Pi 引入了一种在编码代理中递归扩展自动研究循环的方法,在保持基准测试性能的同时,显著减少令牌消耗和成本。

随着编码代理从有监督的代码补全转向无人值守、全天候探索,其工作从孤立的预测扩展到推理、工具使用和反馈的长轨迹。因此,令牌效率对于扩展递归自我改进变得重要。我们在测试平台层采用受RSI启发的方法,将自动研究循环扩展到越来越多的多样化环境中,以进行测试平台部署。在这种规模下,该过程产生可重用的改进,这些改进可转移至其开发环境之外,推动自动化测试平台发现向生产级成果迈进。四个机制通过选择并形成SoL-Pi,涵盖动作执行、上下文压缩、观察处理和委托阅读。在51项任务的EdgeBench评估中,SoL-Pi在GPT-5.6 Sol和Opus 5上实现了与Pi相当的性能,同时将记录的令牌流量减少了44.7-49.0%,API成本降低了约三分之一。换句话说,相对于原生Codex和Claude Code测试平台,估计每小时节省为\8.75-13.50,相对于Pi则为\4.36-5.71。
查看原文
查看缓存全文

缓存时间: 2026/09/18 03:01

论文页面 - SoL-Pi:高效智能体框架的递归扩展自动研究循环

来源:https://huggingface.co/papers/2609.20519 作者: , , , , , , , , , , , ,

摘要

随着编码智能体从监督式代码补全转向全天候无人值守的探索,其工作从孤立的预测扩展为包含推理、工具使用和反馈的长序列过程。因此,令牌效率对于扩展递归自我改进变得至关重要。我们在框架层采用受RSI启发的策略,通过在越来越多且多样的环境中扩展自动研究循环来优化框架运行。在这种规模下,该过程产出的可复用改进超出了其原始开发场景的范围,推动自动框架发现走向生产级成果。四种机制经筛选保留下来,共同构成SoL-Pi,涵盖动作执行、上下文压缩、观测处理和委托阅读。在51项任务的EdgeBench评估中,SoL-Pi在GPT-5.6Sol和Opus5上达到了与Pi相当的性能,同时将记录的令牌流量减少了44.7-49.0%,API成本降低了约三分之一。换言之,与原生Codex和ClaudeCode框架相比,估计每小时可节省8.75-13.50美元;与Pi相比,每小时可节省4.36-5.71美元。

查看arXiv页面 (https://arxiv.org/abs/2609.20519)查看PDF (https://arxiv.org/pdf/2609.20519)项目页面 (https://nvlabs.github.io/SoL-Pi/)GitHub 2.19k (https://github.com/NVlabs/SoL-Pi)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20519)

在智能体中获取此论文:

hf papers read 2609.20519

没有最新CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.20519,即可从本页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.20519,即可从本页面链接。

引用此论文的Spaces 0

没有Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.20519,即可从本页面链接。

包含此论文的收藏夹 0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)即可从本页面链接。

相似文章