DCAS:解耦CLI代理脚手架以跨脚手架内化规划
摘要
本文介绍了DCAS——一种后端替换拦截层,它将CLI代理脚手架与后端模型解耦,从而实现跨脚手架评估。研究表明,在小规模数据集上进行规划感知微调,能够提高模型在非训练脚手架上的泛化能力。
查看缓存全文
缓存时间: 2026/08/10 18:16
论文页面 - DCAS:解耦 CLI 智能体脚手架以在不同脚手架间内化规划
来源:https://huggingface.co/papers/2608.06113
摘要
基于 CLI 的软件工程智能体已迅速成熟,然而开放生态系统却收敛于单一训练环境:用于微调开放模型的轨迹数据集几乎完全在 OpenHands 下收集。在此数据上微调的模型在 OpenHands 下得分良好,但在任何非训练脚手架上部署时性能大幅下降。未训练的基础模型并未表现出这种差异,表明该差距是由微调引发的,并且与训练脚手架的约定相关。我们认为,一种承重的脚手架特定行为是规划结构,本文对此区分了两个含义:显式规划,即作为一等工件生成的事前规划;以及隐式规划,即在智能体循环中塑造执行的结构性约定。在此假设下,弥合差距需要将规划从固定的脚手架工件转变为习得的模型能力。我们引入了 DCAS(解耦 CLI 智能体脚手架),一种后端替换拦截层,可在不修改脚手架的情况下,在任意 CLI 脚手架与任意后端模型之间路由 API 流量,从而实现跨脚手架评估和规划感知的轨迹收集。使用 DCAS,一项受控的规划来源干预证实了规划质量是一个高杠杆组件,其收益超过我们观察到的跨脚手架下降。在单一脚手架下,对一小批 DCAS 收集的规划感知轨迹进行微调的模型,在非训练脚手架上持续获得提升,并且这两种规划含义在训练数据中是在经验上可分离的。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06113) 查看 PDF (https://arxiv.org/pdf/2608.06113) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06113)
引用此论文的模型 0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.06113,即可从本页链接到该模型。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06113,即可从本页链接到该数据集。
引用此论文的 Spaces 0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.06113,即可从本页链接到该 Space。
收录此论文的收藏集 0
暂无收藏集收录此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页链接到该收藏集。
相似文章
SCAFFOLD: 通过递归参数化技能抽象的自我改进网络代理
Scaffold是一个视觉网络代理的自我改进框架,该框架归纳参数化技能,维护递归层次结构,并将技能蒸馏到模型权重中,在诸如WebArena等基准测试中实现了显著的性能提升。
ScaffoldAgent: 基于效用引导的开放式深度研究动态大纲优化
ScaffoldAgent 提出了一个基于效用引导的动态大纲优化框架,用于开放式深度研究。通过扩展、收缩和修订操作,该框架改进了长文报告生成和事实依据的准确性。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2070860837448040832
Google的Agents CLI提供了一个统一的工具,用于搭建、评估和部署AI代理,解决了代理工程中工作流程碎片化的问题。文章演示了如何使用该CLI构建RAG代理,展示了其与编码代理和ADK模式的集成。
GraphDC:一种用于可扩展图算法推理的分治多智能体系统
本文介绍了 GraphDC,这是一个分治多智能体框架,它将图算法任务分解为子图以分配给专门的智能体处理,从而提高了在复杂图结构上的可扩展性和推理性能。
编码代理中的脚手架效应:工具选择作为编码代理评估中的隐藏变量
本文表明,代理工具框架(脚手架)的选择可能导致每个已解决任务的令牌数差异高达40倍,而模型通过率变化很小,这表明在以人为本的编码代理评估中,应该比较工具框架-模型对,而非仅比较模型。