@HuggingPapers: Ai2 刚刚在 Hugging Face 上发布了 TMax 27B,一个 27B 的终端代理,在 Terminal Bench 2.0 上达到 42.7%,与……相媲美
摘要
Ai2 发布了 TMax 27B,一个 27B 的终端代理,在 Terminal Bench 2.0 上取得了 42.7% 的成绩,与比其大 40 倍的模型相媲美。
查看缓存全文
缓存时间: 2026/06/23 13:51
Ai2 刚刚在 Hugging Face 上发布了 TMax 27B。
这是一个 27B 参数的终端代理,在 Terminal Bench 2.0 上达到了 42.7% 的分数, 表现可与比它大 40 倍的模型相媲美。https://t.co/LfCksOXL9L
相似文章
@cuisitekp: 9B 的模型,把比它大好几倍的模型干下去了。 Ai2 和华盛顿大学那拨做 OLMo / Tülu 的人,放出一篇新论文叫 Tmax,自称是目前最强的开源「终端 agent」RL 训练配方。 成绩:一个 9B 模型在 Terminal-Be…
Ai2和华盛顿大学发布论文Tmax,提出目前最强的开源终端智能体RL训练配方。仅用9B参数模型在Terminal-Bench 2.0上击败更大模型,关键在于低成本生成大量可验证训练数据,而非模型规模或算法。
Tmax-27b —— 一款面向小显存GPU的Qwen3.6-27b终端Agent,采用DPPO(强化学习)训练
Ai2发布了Tmax-27B,一个基于Qwen3.6-27B并使用DPPO(RL)训练的终端Agent大语言模型。作者提供了经重要性矩阵校准的GGUF量化版本,即使在极低的比特宽度下也能在Agent基准测试中取得有竞争力的性能,并且移植了MTP草案头用于推测解码。
TMax:终端智能体的简易方案
TMax 提供了一种在终端环境中构建AI智能体的简单方法,结合实用的设计原则,实现高效的命令行自动化。
MiniMaxAI/MiniMax-M2.7
MiniMaxAI发布了MiniMax-M2.7,这是一个开放权重模型,具备自我进化能力、先进的智能体团队支持,并在软件工程基准测试中表现出色(SWE-Pro上56.22%,MLE Bench Lite上66.6%奖牌率),在生产事故恢复和专业工作任务中有显著应用。
@LottoLabs: 这里有一个有趣的模型,35b a3b 专为智能体使用而训练。它在 Terminal Bench2 上获得 60.7 分,而 qwen 3.6 27b 得分为 59.3。关键……
Nex-AGI 发布了 Nex-N2,一个开源的智能体模型系列 (Nex-N2-Pro 和 Nex-N2-mini),采用 Agentic Thinking 框架,统一了推理、工具使用和环境执行,在智能体和编码基准测试中达到顶级性能。