Cognition的SWE-2在Terminal-Bench 2.1上达到92.8分

Hacker News Top 模型

摘要

Cognition的SWE-2模型,基于Kimi K3进行后训练,在Terminal-Bench 2.1上获得92.8分,相较于前沿模型如Fable 5.1和GPT-6 Astra,提供具有竞争力的性能且成本更低。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/10 20:16

# SWE-2 - Tokenstead 来源:https://tokenstead.ai/models/swe-2 TokensteadTokenstead (https://tokenstead.ai/) **2.8万亿总参数,每token激活1040亿参数(混合专家模型)**——基于Kimi K3基础模型,叠加了Cognition的后训练,这也是Cognition首次将强化学习扩展到数万亿参数级别。基础模型本身已针对智能体编码进行了大量强化学习训练;Cognition的后处理在大多数基准测试中又提升了5到6个百分点。 - **服务栈:**采用NVFP4和FP8内核进行混合专家模型推理,并结合量化感知训练;FP8在MLA层中承载K、Q、V及分数计算。经过SpecForge重训练的草稿模型将平均接受长度延长了15%,而预填充延迟器则将每GPU吞吐量(TPM)和每请求处理速度(tokens/sec)提升了10%至20%(首次token生成时间(TTFT)会受到影响)。 - **努力级别:**平均每次运行步数:53(中等)、80(高)、98(最大),对比SWE-1.7的127步。中等努力级别在FrontierCode基准上得分高于SWE-1.7,且所需交互轮次减少58%,平均成本降低81%,首次实际编辑在第18步完成(中位数)(SWE-1.7为第48步)。 柱状图:SWE-2中等努力级别平均需53步完成每次运行,而SWE-1.7需127步;SWE-2在第18步(中位数)完成首次编辑,而SWE-1.7需第48步 **基准测试(Cognition自行报告):**FrontierCode 1.1 Main 50.0,DeepSWE 1.1 73.0,Terminal-Bench 2.1 92.8,Terminal-Bench 4.0 27.3。核心亮点:FrontierCode得分50.0,仅比Claude Fable 5.1(50.9)低1分,比GPT-6 Astra(53.3)低3.3分——而据称其成本比Fable 5.1低64%,仅为Astra的四分之一。Terminal-Bench 2.1是公开榜单中的最高分。短板在于Terminal-Bench 4.0,SWE-2的27.3分明显落后于Fable 5.1(55.8)和GPT-6 Astra(57.9)——在长周期智能体任务上,与前沿水平的差距依然存在。 Cognition发布榜单的记分卡:展示SWE-2、SWE-1.7、Kimi K3、Grok 4.6、Fable 5.1、GPT-5.6 Sol和GPT-6 Astra在FrontierCode 1.1 Main、DeepSWE 1.1、Terminal-Bench 2.1和Terminal-Bench 4.0上的表现。SWE-2在Terminal-Bench 2.1上以92.8分领先,但在Terminal-Bench 4.0上仅得27.3分 FrontierCode 1.1 Main得分柱状图:GPT-6 Astra 53.3,Fable 5.1 50.9,SWE-2 50.0,Grok 4.6 48.0,GPT-5.6 Sol 47.5,Kimi K3 44.2,SWE-1.7 42.0 **权重专有,无法本地运行。**Cognition未公开SWE-2权重,因此无法下载,也无需等待量化版本。该模型现已在Devin Desktop和CLI中提供,并将逐步推出Devin Web和Fusion版本。Cognition未公布SWE-2的逐token API,因此任务成本对比(在FrontierCode同等性能下比Fable 5.1便宜64%)反映的是实际定价面,而非每百万token费率表。所有数据均为Cognition自报,有待独立验证。 codingagentic 参数2800.0B许可专有开发者Cognition (https://cognition.com/)来源🇺🇸 美国发布时间2026年9月 ## 人们正在用SWE-2构建什么 X平台上的真实演示 发布文章:SWE-2,基于Kimi K3后训练 - FrontierCode 1.1 Main 50.0,Terminal-Bench 2.1 92.8查看X推文 → (https://x.com/cognition/status/2098069235733823965) ## 基准测试分数 供应商报告 - 来自开发者自身的模型卡/技术报告 FrontierCode 1.1 Main 50.0 供应商报告 - 来自开发者自身的模型卡/技术报告 ## 或在云端运行 目前尚无针对SWE-2的逐token API提供商定价信息。旗舰版标价详情请参阅计算器 (https://tokenstead.ai/calculator)。 价格历史 ## 推理成本随时间变化 数据从首次每日同步开始积累——更长时间范围内的数据会随时间逐步填充。价格来源于OpenRouter快照,而非历史API。 加载价格历史中...

相似文章

Cognition的SWE-2

Product Hunt

Cognition的SWE-2是一种基于Kimi K3进行后训练的新型编码模型,采用强化学习,在FrontierCode 1.1 Main上达到50.0%的性能,相比Fable 5.1节省64%的成本,同时与GPT-6 Astra具有竞争力。它现在可在Devin Desktop和CLI中使用。