CalibForge:面向可学习终端任务扩展的对抗性求解器校准
摘要
CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - CalibForge:用于扩展可学习终端任务的对抗式求解器校准
来源:https://huggingface.co/papers/2608.06352
摘要
训练终端智能体需要可执行且可验证的任务,这些任务不仅要可求解,还要对学习构成适当的挑战。可执行性验证确立了可行性,但并未揭示任务在给定求解器设置下的行为。在本文中,我们提出 CalibForge——一个自主式终端任务合成系统,它利用经过验证的求解器行为,通过对抗式求解器校准来修订候选任务。多求解器校准针对异构求解器池中的分歧,而对比式求解器校准则针对指定的强通过/弱失败关系;两者都将一种以已验证可解性为锚点的、求解器相对的可学习区间付诸实践。利用 CalibForge,我们构建了 5,431 个经校准的终端任务。消融实验表明,这两种策略都比仅进行编写与验证或普通单求解器反馈能产生更有效的监督。在完整数据集上训练的模型在 Terminal-Bench2.0 上分别达到 32.58% 和 47.57%。与相应基础模型相比,最大提升在 Terminal-Bench2.0 上达到 24.71 个百分点,在 SWE-bench Pro 上达到 27.68 个百分点,在 Doc2Repo 上达到 30.04 个百分点。总体而言,这些结果支持将“求解器相对可学习性”作为构建高效且可迁移的智能体训练数据的实用目标。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06352)查看 PDF (https://arxiv.org/pdf/2608.06352)GitHub4 (https://github.com/AweAI-Team/CalibForge)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06352)
在您的智能体中获取此论文:
hf papers read 2608\.06352
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无关联此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2608.06352,即可从本页面关联该模型。
引用此论文的数据集 0
暂无关联此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2608.06352,即可从本页面关联该数据集。
引用此论文的 Space 0
暂无关联此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2608.06352,即可从本页面关联该 Space。
包含此论文的收藏 0
暂无包含此论文的收藏
将此论文添加到收藏 (https://huggingface.co/new-collection),即可从本页面关联该收藏。
相似文章
CLI-Universe:面向终端代理的可验证任务合成引擎
CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。
CalVerT:使用校准验证器遥测增强智能体,改善知识密集型任务中的行动与学习
CalVerT 为 LLM 智能体引入了校准验证器遥测,提供置信度和基础分数,以减少过度检索和无依据的答案,提升知识密集型问答任务的性能。
LiteCoder-Terminal:扩展用于学习语言智能体的长程终端环境
LiteCoder-Terminal-Gen 引入了一种零依赖的合成管道,可生成可执行的终端训练环境,并产出 SFT 和 RL 数据集,使语言智能体在 Terminal Bench 基准测试上取得显著的性能提升。
Terminal-World: 通过智能体技能扩展终端代理环境
Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。
NexForge:通过需求驱动任务合成扩展LLM的智能体能力
NexForge是一个需求驱动的框架,能够为LLM后训练合成多样化、可执行的智能体任务和专家轨迹,优于先前的方法,并在Terminal-Bench上实现了最先进的开源智能体性能。