terminal-agents

标签

Cards List
#terminal-agents

@dair_ai: Salesforce 发表的一篇令人印象深刻的论文。它讨论了良好验证器对强化学习环境的重要性。只有 35.8% 的 …

X AI KOLs Timeline ↗ · 4天前 缓存

来自 Salesforce 的这篇论文审计了用于终端智能体的公共强化学习环境,发现了重大缺陷,并介绍了 RIVER,一种训练方案,它过滤有缺陷的环境并惩罚重复行为以提升模型性能。

0 人收藏 0 人点赞
#terminal-agents

终端代理的环境演化

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文提出环境演化方法,以离线方式逐步增加终端代理的任务难度,从而增强持续学习信号,并提升在Terminal-Bench 2.1等基准测试上的性能。

0 人收藏 0 人点赞
#terminal-agents

终端代理:命令行环境中AI代理的综述

arXiv cs.AI ↗ · 2026-08-24 缓存

本文综述探讨了在命令行环境中运行的AI代理,提出一个框架,通过终端介导执行的视角,统一软件工程和其他领域的研究。

0 人收藏 0 人点赞
#terminal-agents

Envs-FORGE:面向智能体强化学习的前沿优化奖励导向环境合成

arXiv cs.CL ↗ · 2026-08-17 缓存

Envs-FORGE是一种提示策略,用于为强化学习智能体合成训练环境,将验证器奖励转换为每个种子操作,以提高在SWE-bench和Terminal-Bench等基准测试上的性能。

0 人收藏 0 人点赞
#terminal-agents

CalibForge:面向可学习终端任务扩展的对抗性求解器校准

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。

0 人收藏 0 人点赞
#terminal-agents

长时程终端任务的递归合成

Hugging Face Daily Papers ↗ · 2026-08-05 缓存

本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。

0 人收藏 0 人点赞
#terminal-agents

基于Docker化环境的大规模终端智能体轨迹生成

arXiv cs.CL ↗ · 2026-07-20 缓存

TerminalTraj是一个可扩展的流水线,利用Docker化环境生成高质量的终端智能体轨迹,在终端任务基准上使用TerminalTraj-32B等模型实现了高达20%的性能提升。

0 人收藏 0 人点赞
#terminal-agents

@Suhail:这是一篇关于用强化学习对LLM进行后训练的优秀入门文章。整套流程和数据都是开放的。强烈推荐!

X AI KOLs Following ↗ · 2026-06-27 缓存

Hamish Ivison及其团队发布了Tmax,这是一个开源、基于强化学习的终端代理模型,在标准设置下性能优于此前的工作。所有数据、权重和运行记录均已公开发布。

0 人收藏 0 人点赞
#terminal-agents

CLI-Universe:面向终端代理的可验证任务合成引擎

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

CLI-Universe是一个合成引擎,通过多维能力分类体系和证据引导的研究生成可验证的终端代理任务,并产生包含6000条轨迹的精炼数据集。在该数据集上微调Qwen3-32B,在Terminal-Bench 2.0上达到了33.4%,为参数量在32B及以下的开源模型树立了新的最优水平。

0 人收藏 0 人点赞
#terminal-agents

Tmax:一种简单的终端智能体配方

Hugging Face Daily Papers ↗ · 2026-06-22 缓存

Tmax 引入了一种简化的终端智能体强化学习训练配方,通过新颖的数据生成分类法和扩展的开源数据集,使用 9B 参数模型实现了最先进的性能。

0 人收藏 0 人点赞
#terminal-agents

Terminal-World: 通过智能体技能扩展终端代理环境

arXiv cs.CL ↗ · 2026-05-21 缓存

Terminal-World 引入了一个全自动流水线,利用智能体技能为终端代理合成高质量的训练数据,使得模型仅使用 1.2% 的训练数据就能超越基线。该方法从技能原语中共同推导出任务指令、环境和教师轨迹。

0 人收藏 0 人点赞
#terminal-agents

@omarsar0:AI 开发者请留意,若你在开发长周期终端智能体,这条推文尤其值得关注……

X AI KOLs Following ↗ · 2026-04-22 缓存

TACO 是一个自我演化的框架,可自动发现并优化长周期终端智能体的上下文压缩规则。

0 人收藏 0 人点赞
#terminal-agents

一种基于观测上下文压缩的高效终端智能体自我演化框架

Hugging Face Daily Papers ↗ · 2026-04-21 缓存

TACO 提出了一种自我演化压缩框架,可自动学习压缩冗余的终端交互历史,在 TerminalBench 及其他代码智能体基准上将 token 开销降低约 10%,准确率提升 1–4%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈