CalibForge:面向可学习终端任务扩展的对抗性求解器校准

Hugging Face Daily Papers 论文

摘要

CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。

训练终端智能体需要可执行且可验证的任务,这些任务不仅要可求解,还要具有适度的学习挑战性。可执行验证确立了可行性,但并未揭示任务在给定求解器设置下的表现。本文提出 CalibForge,一个自主终端任务合成系统,通过对抗性求解器校准,利用经过验证的求解器行为来修正候选任务。多求解器校准针对异构求解器池中的分歧,而对比性求解器校准则针对指定的强通过/弱失败关系;两者都将基于已证明可解性的求解器相对可学习区域操作化。使用 CalibForge,我们构建了 5,431 个校准终端任务。我们的消融实验表明,这两种策略都比仅进行编写和验证或仅使用单一求解器反馈提供更有效的监督。在完整集合上训练的模型在 Terminal-Bench 2.0 上达到 32.58% 和 47.57% 的准确率。与相应基础模型相比,最大提升在 Terminal-Bench 2.0 上达到 24.71 个百分点,在 SWE-bench Pro 上达到 27.68 个百分点,在 Doc2Repo 上达到 30.04 个百分点。这些结果共同支持将求解器相对可学习性作为构建有效且可迁移的智能体训练数据的实用目标。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:55

论文页面 - CalibForge:用于扩展可学习终端任务的对抗式求解器校准

来源:https://huggingface.co/papers/2608.06352

摘要

训练终端智能体需要可执行且可验证的任务,这些任务不仅要可求解,还要对学习构成适当的挑战。可执行性验证确立了可行性,但并未揭示任务在给定求解器设置下的行为。在本文中,我们提出 CalibForge——一个自主式终端任务合成系统,它利用经过验证的求解器行为,通过对抗式求解器校准来修订候选任务。多求解器校准针对异构求解器池中的分歧,而对比式求解器校准则针对指定的强通过/弱失败关系;两者都将一种以已验证可解性为锚点的、求解器相对的可学习区间付诸实践。利用 CalibForge,我们构建了 5,431 个经校准的终端任务。消融实验表明,这两种策略都比仅进行编写与验证或普通单求解器反馈能产生更有效的监督。在完整数据集上训练的模型在 Terminal-Bench2.0 上分别达到 32.58% 和 47.57%。与相应基础模型相比,最大提升在 Terminal-Bench2.0 上达到 24.71 个百分点,在 SWE-bench Pro 上达到 27.68 个百分点,在 Doc2Repo 上达到 30.04 个百分点。总体而言,这些结果支持将“求解器相对可学习性”作为构建高效且可迁移的智能体训练数据的实用目标。

查看 arXiv 页面 (https://arxiv.org/abs/2608.06352)查看 PDF (https://arxiv.org/pdf/2608.06352)GitHub4 (https://github.com/AweAI-Team/CalibForge)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06352)

在您的智能体中获取此论文:

hf papers read 2608\.06352

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无关联此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2608.06352,即可从本页面关联该模型。

引用此论文的数据集 0

暂无关联此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2608.06352,即可从本页面关联该数据集。

引用此论文的 Space 0

暂无关联此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2608.06352,即可从本页面关联该 Space。

包含此论文的收藏 0

暂无包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection),即可从本页面关联该收藏。

相似文章

CLI-Universe:面向终端代理的可验证任务合成引擎

Hugging Face Daily Papers

CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。

Terminal-World: 通过智能体技能扩展终端代理环境

arXiv cs.CL

Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。