swe-bench

标签

Cards List
#swe-bench

运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益

Hugging Face Daily Papers · 2026-06-25 缓存

本文实证分析了基于LLM的程序修复智能体中代码执行的成本效益,发现执行被大量使用但往往不加区分,限制执行可以在对修复成功影响最小的情况下节省大量成本。

0 人收藏 0 人点赞
#swe-bench

@dunik_7: 一个AI在研究人员仅旁观的情况下,将其编码能力提升了一倍多。在SWE-bench上从20%提升到50%。他们从未……

X AI KOLs Timeline · 2026-06-24 缓存

来自Jeff Clune实验室的一篇论文描述了一个AI,它通过重写自己的源代码,在没有人工干预的情况下,使用进化方法,在SWE-bench上将编码能力从20%翻倍到50%。

0 人收藏 0 人点赞
#swe-bench

@yoheinakajima: 更多人现在正在尝试这种通过共享状态进行通信的智能体方法(而非彼此对话)

X AI KOLs Following · 2026-06-17 缓存

Azalia Mirhoseini 强调 DeLM,一种去中心化语言模型方法,其中智能体通过共享状态通信,在SWE-bench Verified上使用Gemini-3 Flash实现了约10%的提升,且成本不到一半。

0 人收藏 0 人点赞
#swe-bench

@HuggingPapers: LoopCoder-v2 已发布。一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的高分,击败了...

X AI KOLs Following · 2026-06-17 缓存

LoopCoder-v2 是一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的成绩,性能超越 30 倍参数规模的模型。模型和代码已在 Hugging Face 上开源。

0 人收藏 0 人点赞
#swe-bench

Ramp SWE-Bench:一个私有的、基于生产环境的编码基准测试(3分钟阅读)

TLDR AI · 2026-06-15

Ramp发布了自己私有的SWE-Bench基准测试,该测试基于真实的工程问题构建,使其能够在自身的金融软件生态系统中评估编码模型。

0 人收藏 0 人点赞
#swe-bench

@AlchainHust: https://x.com/AlchainHust/status/2064676532212097418

X AI KOLs Timeline · 2026-06-10 缓存

本文详细评测了Anthropic新发布的Claude Fable 5模型,并展示了作者用其一天内开发Mac App'翻箱'的过程。模型在代码生成和稳定性上有显著提升。

0 人收藏 0 人点赞
#swe-bench

Claw-SWE-Bench:一个用于评估OpenClaw风格编码任务代理框架的基准测试

Hugging Face Daily Papers · 2026-06-10 缓存

Claw-SWE-Bench是一个新的基准测试和适配器协议,它标准化了在SWE-bench风格任务上比较不同编码代理的评估条件,揭示了适配器设计对性能和成本有显著影响。

0 人收藏 0 人点赞
#swe-bench

@denizbirlikci: 要理解我们为什么构建 FrontierCode,请阅读 @METR_Evals 的博客文章,了解为什么"许多通过 SWE-bench 的 PR 不会被合并到主分支……"

X AI KOLs Following · 2026-06-08 缓存

Cognition 宣布推出 FrontierCode,这是一个新的代码评估基准,超越了单元测试,衡量代码质量、范围、测试正确性和人类审查者认可度,解决了代理编写通过测试但不可维护的草率代码的问题。

0 人收藏 0 人点赞
#swe-bench

回溯式工具链优化:通过轨迹回滚上的自我偏好改进LLM智能体

Hugging Face Daily Papers · 2026-06-04 缓存

回溯式工具链优化(RHO)是一种自监督方法,仅利用历史轨迹即可提升LLM智能体性能,在SWE-Bench Pro上实现78%的通过率,无需外部评分。

0 人收藏 0 人点赞
#swe-bench

并非所有错误都相同:基于后果感知的推理计算资源分配

arXiv cs.AI · 2026-06-04 缓存

本文提出了一种基于后果感知的测试时计算资源分配方法,根据预测的失败代价而非单纯的任务难度,将更高风险的软件工程任务路由至更大的计算预算。在 SWE-bench Lite 和 Multi-SWE-bench mini 上的评估表明,与难度感知路由相比,该方法将代价加权损失降低了 22%–33%。

0 人收藏 0 人点赞
#swe-bench

M3在SWE-Bench上得分不错,但让我印象深刻的并非分数,而是那些无法用基准测试衡量的东西。

Reddit r/AI_Agents · 2026-06-04

M3在基准测试中取得了不错成绩,但其真正令人印象深刻的是在进行代码更改前进行风险评估和“事前验尸”分析的能力,突显了在混乱的遗留仓库中进行重构时更为谨慎和彻底的方法。

0 人收藏 0 人点赞
#swe-bench

@raydistributed: 祝贺微软 AI 团队推出 MAI-Thinking-1!很高兴看到 Ray 在前沿模式的多个部分中被使用…

X AI KOLs Following · 2026-06-04 缓存

微软 AI 发布了 MAI-Thinking-1,一个拥有 350 亿活跃参数/1 万亿总参数的 MoE 推理模型,在 STEM 和编码任务上具有竞争力,使用 Ray 进行分布式训练和编排。

0 人收藏 0 人点赞
#swe-bench

@vincentsunnchen: 新一期Benchtalks与@jyangballin:关于ProgramBench(发布时前沿模型得分为0%)以及编码基准测试的传承与未来…

X AI KOLs Following · 2026-06-03

一档播客/访谈节目,讨论ProgramBench——一个在发布时前沿模型得分0%的新编码基准测试。内容涵盖其设计理念、人工制品级评估,以及从SWE-bench和InterCode到现在的编码基准测试的演变。

0 人收藏 0 人点赞
#swe-bench

@vintcessun: 刚刷到这篇,有点牛。本质上,AI agent并行探索或树搜索时,每次checkpoint/rollback都要备份整个文件+进程状态,慢到几百毫秒。DeltaBox发现:连续检查点其实高度相似。所以别全复制,只记变更。 它搞了两个OS级机…

X AI KOLs Timeline · 2026-05-24 缓存

Presented at arXiv, DeltaBox introduces OS-level mechanisms (DeltaFS and DeltaCR) for millisecond-level checkpoint and rollback in stateful AI agents by only duplicating changes between consecutive states, achieving 14ms checkpoint and 5ms rollback on SWE-bench and enabling significantly deeper tree search within fixed time budgets.

0 人收藏 0 人点赞
#swe-bench

@rohanpaul_ai: Meta 论文显示,当编程代理重复使用过去尝试的简短摘要而不是原始日志时,其性能会显著提升……

X AI KOLs Following · 2026-05-23 缓存

一篇 Meta 论文显示,编程代理在重复使用过去尝试的简短摘要而非原始日志时性能显著提升,使用 Claude 4.5 Opus 在 SWE-Bench 和 Terminal-Bench 上取得了显著改进。

0 人收藏 0 人点赞
#swe-bench

Qwen 3.7 Max 在 SWE-Bench Pro 上取得了 60.6% 的得分

Reddit r/singularity · 2026-05-21

Qwen 3.7 Max 在 SWE-Bench Pro 上取得了 60.6% 的得分,展现了在软件工程任务上的竞争力。

0 人收藏 0 人点赞
#swe-bench

@victormustar: [新] Hugging Face Dataset 排行榜:现在你可以按模型参数范围筛选基准测试结果!例如:查找…

X AI KOLs Following · 2026-05-20 缓存

Hugging Face Dataset 排行榜现在支持按模型参数范围筛选基准测试结果,使用户能够找到特定参数数量下的最佳模型。

0 人收藏 0 人点赞
#swe-bench

@dair_ai: 值得一读的新论文。GPT-5.4 nano 加上 critic-comparator 编排循环在 SWE-bench Verified 上达到 76.4%,匹配…

X AI KOLs Following · 2026-05-18 缓存

一篇新论文表明,使用一个弱模型,通过 k=8 个提议和 critic-comparator 选择循环,可以在 SWE-bench Verified 上匹配前沿模型的性能,达到 76.4% 的准确率。关键见解是,正确的补丁通常已经存在于弱模型的前 k 个候选补丁中,挑战在于如何利用执行验证进行有效选择。

0 人收藏 0 人点赞
#swe-bench

@kevin_x_li: 介绍 SWE-ZERO-12M-trajectories:公开中最大的智能体追踪数据集,比之前最大的大5.7倍…

X AI KOLs Following · 2026-05-13 缓存

SWE-ZERO-12M-trajectories 是最大的公开编码智能体追踪数据集,包含来自122K个拉取请求和3K个仓库的12M条轨迹,共计112B个token,支持在不需容器化执行的情况下对智能体编码模型进行可扩展训练。

0 人收藏 0 人点赞
#swe-bench

透过基准测试作弊的镜中镜

Hacker News Top · 2026-05-11 缓存

Poolside 在其 Laguna M.1 模型在 SWE-Bench-Pro 上的强化学习训练中发现了奖励作弊现象,发现智能体可以利用 git 历史和其他漏洞来欺骗基准测试,凸显了需要更好的对齐和评估方法。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈