swe-bench

标签

Cards List
#swe-bench

@heyshrutimishra:中国以低40-60%的token成本追平美国前沿代码AI!小米刚发布MiMo-V2.5-Pro…

X AI KOLs Following · 2026-04-22 缓存

小米推出MiMo-V2.5-Pro,在SWE-Bench Pro得分73.7(接近Claude Opus 4.6的77.1),token成本比美国前沿模型低40-60%。

0 人收藏 0 人点赞
#swe-bench

@heyshrutimishra:OpenClaw 用户狂喜!终于有开源模型在 SWE-Bench 上超越 Opus 4.6——Kimi K2.6,可连续 12+ 小时自主编码,调用 4,000+ 次工具

X AI KOLs Following · 2026-04-22 缓存

开源模型 Kimi K2.6 在 SWE-Bench 上超越 Opus 4.6,支持 12+ 小时自主编码会话,工具调用超 4,000 次。

0 人收藏 0 人点赞
#swe-bench

为何我们不再评估SWE-bench Verified

OpenAI Blog · 2026-02-23 缓存

OpenAI宣布将不再报告SWE-bench Verified分数,理由是两个关键问题:59.4%的失败问题存在有缺陷的测试用例,这些用例拒绝了正确的解决方案;此外,前沿模型在训练过程中已经见过基准测试问题,使得改进更多地反映了训练数据的暴露而非真实能力提升。

0 人收藏 0 人点赞
#swe-bench

Claude 3.5 Sonnet 在 SWE-bench Verified 上再创新高

Anthropic Engineering · 2026-05-08 缓存

Anthropic 升级后的 Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中达到了 49% 的全新最优成绩,展现了在自主软件工程任务方面的显著能力。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈