swe-bench

标签

Cards List
#swe-bench

@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……

X AI KOLs Timeline · 2026-07-09 缓存

TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。

0 人收藏 0 人点赞
#swe-bench

@OpenAI: 为了审计SWE-Bench Pro,我们使用了基于模型的调查代理以及来自五位独立专家的独立评审…

X AI KOLs · 2026-07-08 缓存

OpenAI 描述了对 SWE-Bench Pro 的审计过程,使用了基于模型的调查代理和来自经验丰富的软件工程师的独立评审,以确保在大规模下的全面评估。

0 人收藏 0 人点赞
#swe-bench

@OpenAI: 我们审计了SWE-Bench Pro,这是最广泛使用的AI编程基准之一,发现它已无法可靠地衡量前沿…

X AI KOLs · 2026-07-08 缓存

OpenAI审计了SWE-Bench Pro编码基准,发现约30%的任务存在故障,因此撤回了此前将其作为主要编码评估的建议。

0 人收藏 0 人点赞
#swe-bench

在编码评估中分离信号与噪声

Hacker News Top · 2026-07-08 缓存

OpenAI 对编码基准 SWE-Bench Pro 进行了审计,发现约 30% 的任务因测试过于严格和提示不够明确等问题而存在缺陷,建议模型开发者仔细检查结果。

0 人收藏 0 人点赞
#swe-bench

Hy3 基准测试综述:从 SWE-Bench Pro 到 312 个真实工作流任务

Reddit r/singularity · 2026-07-07

基准测试综述,涵盖 SWE-Bench Pro 和 312 个真实工作流任务,可能用于评估人工智能在软件工程挑战中的表现。

0 人收藏 0 人点赞
#swe-bench

SWE-Review:通过智能体代码审查实现问题解决的闭环

Hugging Face Daily Papers · 2026-07-07 缓存

本文介绍了SWE-Review,这是一个通过迭代的智能体审查和修订循环来闭环AI生成的拉取请求的框架,从而提高了代码质量和问题解决能力。实验结果表明,它优于单轮审查,并实现了有效的测试时扩展。

0 人收藏 0 人点赞
#swe-bench

具有随时有效证书的自演化代理

arXiv cs.AI · 2026-07-02 缓存

本文介绍了SEA,一种用于自演化代理的架构,它将自我修改限制在转向适配器和围绕冻结基础模型的版本化框架上,并使用随时有效门(anytime-valid gates)来根据固定错误预算审计修改。在SWE-bench Verified上使用四个基础模型进行的实验表明,该套件在强基础模型上提供了+4%到+5%的提升,同时防止了性能回退。

0 人收藏 0 人点赞
#swe-bench

Senior SWE-Bench:评估作为高级工程师的AI代理的开源基准

Hacker News Top · 2026-07-02 缓存

Senior SWE-Bench 是一个开源基准,用于评估AI代理在需要高级技能的软件工程任务上的表现。

0 人收藏 0 人点赞
#swe-bench

SWE-rebench 排行榜更新:GLM-5.2、Qwen3.6-27B、Qwen3.6-35B-A3B、Gemma 4 31B 等新模型 + 改进的 UI

Reddit r/LocalLLaMA · 2026-07-01 缓存

SWE-rebench 排行榜已更新,新增了 GLM-5.2、Qwen3.6、Gemma 4 31B 等模型,并改进了 UI,展示了软件工程任务上的性能排名。

0 人收藏 0 人点赞
#swe-bench

@nathanhabib1011: SWE-bench_pro 上参数低于 128B 的最佳模型… @Alibaba_Qwen 3.6 27b 依然疯狂,紧随其后的是 @ornith_ 35B

X AI KOLs Following · 2026-06-30 缓存

推文突出了 SWE-bench_pro 基准测试中参数低于 128B 的顶级 AI 模型,指出阿里 Qwen 3.6 27B 和 ornith 35B 是领先的竞争者。

0 人收藏 0 人点赞
#swe-bench

@no_stp_on_snek: 有人会晃着成绩卡对我说:9B模型在编程基准测试中碾压了它的基础模型(SWE-bench 69 vs 53)。确实如此。但关于……

X AI KOLs Following · 2026-06-28 缓存

一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。

0 人收藏 0 人点赞
#swe-bench

GitHub:我们将 GitHub Copilot 的代理工具套件与原生搭载领先模型的工具套件进行了基准测试。在保持…

X AI KOLs Following · 2026-06-28 缓存

GitHub 对自家 Copilot 的代理工具套件与模型供应商的工具套件进行了基准测试,发现在多个基准测试中,任务解决能力相当,但使用的 token 更少,突显了 Copilot 支持超过 20 个模型的特点。

0 人收藏 0 人点赞
#swe-bench

@HowToPrompt__: 这绝对是违法的。有人用纯Python完整重现了Claude Code,并免费发布到了GitHub上。→ 运行于任何模型…

X AI KOLs Timeline · 2026-06-28 缓存

一个完全开源的Claude Code Python复制版已在GitHub上发布,支持多种模型(如GPT、Gemini),在SWE-bench Verified上达到58.2%的成绩,并号称比原版便宜6倍。

0 人收藏 0 人点赞
#swe-bench

运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益

Hugging Face Daily Papers · 2026-06-25 缓存

本文实证分析了基于LLM的程序修复智能体中代码执行的成本效益,发现执行被大量使用但往往不加区分,限制执行可以在对修复成功影响最小的情况下节省大量成本。

0 人收藏 0 人点赞
#swe-bench

@dunik_7: 一个AI在研究人员仅旁观的情况下,将其编码能力提升了一倍多。在SWE-bench上从20%提升到50%。他们从未……

X AI KOLs Timeline · 2026-06-24 缓存

来自Jeff Clune实验室的一篇论文描述了一个AI,它通过重写自己的源代码,在没有人工干预的情况下,使用进化方法,在SWE-bench上将编码能力从20%翻倍到50%。

0 人收藏 0 人点赞
#swe-bench

@yoheinakajima: 更多人现在正在尝试这种通过共享状态进行通信的智能体方法(而非彼此对话)

X AI KOLs Following · 2026-06-17 缓存

Azalia Mirhoseini 强调 DeLM,一种去中心化语言模型方法,其中智能体通过共享状态通信,在SWE-bench Verified上使用Gemini-3 Flash实现了约10%的提升,且成本不到一半。

0 人收藏 0 人点赞
#swe-bench

@HuggingPapers: LoopCoder-v2 已发布。一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的高分,击败了...

X AI KOLs Following · 2026-06-17 缓存

LoopCoder-v2 是一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的成绩,性能超越 30 倍参数规模的模型。模型和代码已在 Hugging Face 上开源。

0 人收藏 0 人点赞
#swe-bench

Ramp SWE-Bench:一个私有的、基于生产环境的编码基准测试(3分钟阅读)

TLDR AI · 2026-06-15

Ramp发布了自己私有的SWE-Bench基准测试,该测试基于真实的工程问题构建,使其能够在自身的金融软件生态系统中评估编码模型。

0 人收藏 0 人点赞
#swe-bench

@AlchainHust: https://x.com/AlchainHust/status/2064676532212097418

X AI KOLs Timeline · 2026-06-10 缓存

本文详细评测了Anthropic新发布的Claude Fable 5模型,并展示了作者用其一天内开发Mac App'翻箱'的过程。模型在代码生成和稳定性上有显著提升。

0 人收藏 0 人点赞
#swe-bench

Claw-SWE-Bench:一个用于评估OpenClaw风格编码任务代理框架的基准测试

Hugging Face Daily Papers · 2026-06-10 缓存

Claw-SWE-Bench是一个新的基准测试和适配器协议,它标准化了在SWE-bench风格任务上比较不同编码代理的评估条件,揭示了适配器设计对性能和成本有显著影响。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈