Cognition的SWE-2在Terminal-Bench 2.1上达到92.8分
摘要
Cognition的SWE-2模型,基于Kimi K3进行后训练,在Terminal-Bench 2.1上获得92.8分,相较于前沿模型如Fable 5.1和GPT-6 Astra,提供具有竞争力的性能且成本更低。
暂无内容
查看缓存全文
缓存时间: 2026/09/10 20:16
# SWE-2 - Tokenstead
来源:https://tokenstead.ai/models/swe-2
TokensteadTokenstead (https://tokenstead.ai/)
**2.8万亿总参数,每token激活1040亿参数(混合专家模型)**——基于Kimi K3基础模型,叠加了Cognition的后训练,这也是Cognition首次将强化学习扩展到数万亿参数级别。基础模型本身已针对智能体编码进行了大量强化学习训练;Cognition的后处理在大多数基准测试中又提升了5到6个百分点。
- **服务栈:**采用NVFP4和FP8内核进行混合专家模型推理,并结合量化感知训练;FP8在MLA层中承载K、Q、V及分数计算。经过SpecForge重训练的草稿模型将平均接受长度延长了15%,而预填充延迟器则将每GPU吞吐量(TPM)和每请求处理速度(tokens/sec)提升了10%至20%(首次token生成时间(TTFT)会受到影响)。
- **努力级别:**平均每次运行步数:53(中等)、80(高)、98(最大),对比SWE-1.7的127步。中等努力级别在FrontierCode基准上得分高于SWE-1.7,且所需交互轮次减少58%,平均成本降低81%,首次实际编辑在第18步完成(中位数)(SWE-1.7为第48步)。
柱状图:SWE-2中等努力级别平均需53步完成每次运行,而SWE-1.7需127步;SWE-2在第18步(中位数)完成首次编辑,而SWE-1.7需第48步
**基准测试(Cognition自行报告):**FrontierCode 1.1 Main 50.0,DeepSWE 1.1 73.0,Terminal-Bench 2.1 92.8,Terminal-Bench 4.0 27.3。核心亮点:FrontierCode得分50.0,仅比Claude Fable 5.1(50.9)低1分,比GPT-6 Astra(53.3)低3.3分——而据称其成本比Fable 5.1低64%,仅为Astra的四分之一。Terminal-Bench 2.1是公开榜单中的最高分。短板在于Terminal-Bench 4.0,SWE-2的27.3分明显落后于Fable 5.1(55.8)和GPT-6 Astra(57.9)——在长周期智能体任务上,与前沿水平的差距依然存在。
Cognition发布榜单的记分卡:展示SWE-2、SWE-1.7、Kimi K3、Grok 4.6、Fable 5.1、GPT-5.6 Sol和GPT-6 Astra在FrontierCode 1.1 Main、DeepSWE 1.1、Terminal-Bench 2.1和Terminal-Bench 4.0上的表现。SWE-2在Terminal-Bench 2.1上以92.8分领先,但在Terminal-Bench 4.0上仅得27.3分
FrontierCode 1.1 Main得分柱状图:GPT-6 Astra 53.3,Fable 5.1 50.9,SWE-2 50.0,Grok 4.6 48.0,GPT-5.6 Sol 47.5,Kimi K3 44.2,SWE-1.7 42.0
**权重专有,无法本地运行。**Cognition未公开SWE-2权重,因此无法下载,也无需等待量化版本。该模型现已在Devin Desktop和CLI中提供,并将逐步推出Devin Web和Fusion版本。Cognition未公布SWE-2的逐token API,因此任务成本对比(在FrontierCode同等性能下比Fable 5.1便宜64%)反映的是实际定价面,而非每百万token费率表。所有数据均为Cognition自报,有待独立验证。
codingagentic
参数2800.0B许可专有开发者Cognition (https://cognition.com/)来源🇺🇸 美国发布时间2026年9月
## 人们正在用SWE-2构建什么
X平台上的真实演示
发布文章:SWE-2,基于Kimi K3后训练 - FrontierCode 1.1 Main 50.0,Terminal-Bench 2.1 92.8查看X推文 → (https://x.com/cognition/status/2098069235733823965)
## 基准测试分数
供应商报告 - 来自开发者自身的模型卡/技术报告
FrontierCode 1.1 Main
50.0
供应商报告 - 来自开发者自身的模型卡/技术报告
## 或在云端运行
目前尚无针对SWE-2的逐token API提供商定价信息。旗舰版标价详情请参阅计算器 (https://tokenstead.ai/calculator)。
价格历史
## 推理成本随时间变化
数据从首次每日同步开始积累——更长时间范围内的数据会随时间逐步填充。价格来源于OpenRouter快照,而非历史API。
加载价格历史中...
相似文章
Cognition的SWE-2
Cognition的SWE-2是一种基于Kimi K3进行后训练的新型编码模型,采用强化学习,在FrontierCode 1.1 Main上达到50.0%的性能,相比Fable 5.1节省64%的成本,同时与GPT-6 Astra具有竞争力。它现在可在Devin Desktop和CLI中使用。
Cognition 推出新型 SWE-2 模型,与 Fable 5.1 和 GPT-Astra 相媲美
Cognition 推出 SWE-2,这是一款先进的编码模型,以极低的成本实现了与 Fable 5.1 和 GPT-Astra 相竞争的性能,利用新型强化学习来优化成本效益前沿。
@cognition: 推出 SWE-2,这是我们迄今最接近前沿的模型。在主流评估中,它的得分与近期前沿模型持平…
SWE-2 是一个AI模型,通过扩展强化学习,在成本降低高达70%的情况下匹配前沿性能。
@VictorKaiWang1:在 Terminal Bench 2.1 上达到 95.3%,DeepSeek V4 Flash + StateM,在 TB2.1 上为 88.8%
研究人员使用 DeepSeek V4 Flash 和 StateM 在 Terminal-Bench 2.1 上达到了 95.3% 的准确率,匹配了 GPT-5.6 Sol Max 的性能,并探索了超越模型扩展的智能体改进。
@cognition: 昨天我们发布了基于开源Kimi K2.7的SWE-1.7。关于中国基础模型的担忧是真实存在的:K2.7完成…
Cognition发布了SWE-1.7,该模型基于开源Kimi K2.7构建,并通过可信性训练来解决对中国基础模型的担忧。