task-synthesis

标签

Cards List
#task-synthesis

FACET: 在终端任务合成中保留源意图和可执行状态

Hugging Face Daily Papers ↗ · 2026-08-19 缓存

FACET是一个框架,通过保留源意图和确保跨工件一致性,为AI代理训练合成高质量的终端任务,从而在Terminal-Bench 2.1上提升性能。

0 人收藏 0 人点赞
#task-synthesis

CalibForge:面向可学习终端任务扩展的对抗性求解器校准

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。

0 人收藏 0 人点赞
#task-synthesis

CLI-Universe:面向终端代理的可验证任务合成引擎

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。

0 人收藏 0 人点赞
#task-synthesis

关于TASTE:提升智能体基准测试的覆盖度与难度

Hugging Face Daily Papers ↗ · 2026-05-27 缓存

TASTE是一种自动化方法,通过自适应对比n-gram建模和迭代难度优化来演化工具序列,从而生成覆盖更广工具使用、更具挑战性的智能体基准测试。生成的τ^c-Bench显示,在现有基准测试中几乎饱和的模型性能大幅下降,表明这是基准饱和而非模型具备稳健能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈