SoL-Pi:递归扩展自动研究循环以实现高效代理框架
摘要
SoL-Pi 引入了一种在编码代理中递归扩展自动研究循环的方法,在保持基准测试性能的同时,显著减少令牌消耗和成本。
查看缓存全文
缓存时间: 2026/09/18 03:01
论文页面 - SoL-Pi:高效智能体框架的递归扩展自动研究循环
来源:https://huggingface.co/papers/2609.20519 作者: , , , , , , , , , , , ,
摘要
随着编码智能体从监督式代码补全转向全天候无人值守的探索,其工作从孤立的预测扩展为包含推理、工具使用和反馈的长序列过程。因此,令牌效率对于扩展递归自我改进变得至关重要。我们在框架层采用受RSI启发的策略,通过在越来越多且多样的环境中扩展自动研究循环来优化框架运行。在这种规模下,该过程产出的可复用改进超出了其原始开发场景的范围,推动自动框架发现走向生产级成果。四种机制经筛选保留下来,共同构成SoL-Pi,涵盖动作执行、上下文压缩、观测处理和委托阅读。在51项任务的EdgeBench评估中,SoL-Pi在GPT-5.6Sol和Opus5上达到了与Pi相当的性能,同时将记录的令牌流量减少了44.7-49.0%,API成本降低了约三分之一。换言之,与原生Codex和ClaudeCode框架相比,估计每小时可节省8.75-13.50美元;与Pi相比,每小时可节省4.36-5.71美元。
查看arXiv页面 (https://arxiv.org/abs/2609.20519)查看PDF (https://arxiv.org/pdf/2609.20519)项目页面 (https://nvlabs.github.io/SoL-Pi/)GitHub 2.19k (https://github.com/NVlabs/SoL-Pi)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.20519)
在智能体中获取此论文:
hf papers read 2609.20519
没有最新CLI?请运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.20519,即可从本页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.20519,即可从本页面链接。
引用此论文的Spaces 0
没有Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.20519,即可从本页面链接。
包含此论文的收藏夹 0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)即可从本页面链接。
相似文章
Pi Agent 用户 - Nvidia 推出 Sol-Pi - 基于 AutoResearch 循环的 Pi 扩展,提升 Harness 效率
SoL-Pi 是针对 Pi agents 的独立扩展,通过行动融合和上下文压缩等机制减少令牌流量和推理工作,从而提升效率。所有功能均为可选启用,并保留原始证据。
@omarsar0: // Scaling Laws for Agent Harnesses // 如果你构建代理框架,这篇文章值得一看。(收藏)大多数 harness…
关于代理框架缩放定律的新研究显示,大多数字令和工具调用次数并不重要;该研究引入了一种有效的方法。
@hooshaaii: 扩展推理不仅仅是更长的上下文——而是修复递归自我改进(RSI)中的'上下文拖拽'。IC…
本文介绍了Dream-RSI,一个用于AI代理可扩展递归自我改进的框架,它使用重放模拟器来优化探索策略,降低发现成本并提高质量。
记住,不要重读:用于令牌高效自主实验的有状态ReAct智能体
本文提出使用LangGraph中的有状态ReAct智能体取代无状态自动研究模式,将每次迭代的令牌成本从O(n)降低至O(1),在超参数调优和代码优化基准测试中实现了52-90%的令牌减少。
AutoLLMResearch:通过从低成本学习来优化高成本,训练研究智能体以自动化大型语言模型实验配置
本文介绍了 AutoLLMResearch,这是一个智能体框架,旨在通过在低保真环境中学习并外推至高成本设置,实现昂贵的大型语言模型(LLM)实验配置的自动化。其目标是减少可扩展 LLM 研究中的计算浪费以及对专家直觉的依赖。