swe-bench

标签

Cards List
#swe-bench

SWE-Pruner Pro:编程大语言模型早已知道该修剪什么

Hugging Face Daily Papers · 2天前 缓存

SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。

0 人收藏 0 人点赞
#swe-bench

@thesupermanmx: 中国刚刚改变了游戏规则。他们发布了一个开源模型,仅消耗你们最喜欢的美国模型1%的token…

X AI KOLs Timeline · 6天前 缓存

中国发布了Ling-2.6-1T,一个1万亿参数的开源模型,在256K上下文窗口中SWE-bench上达到72.2%,声称高效且兼容Claude Code。

0 人收藏 0 人点赞
#swe-bench

你只需要前沿模型进行单次编辑

Hacker News Top · 2026-07-15 缓存

一篇博客文章认为,仅使用前沿模型进行规划,而使用更便宜的模型执行,这种做法并不划算,因为读取(而非编辑)才是主要的成本驱动因素;重复读取会抵消任何节省。

0 人收藏 0 人点赞
#swe-bench

面向函数的中间填充作为编码智能体基础模型的中间训练

arXiv cs.AI · 2026-07-15 缓存

本文提出了一种面向函数的中间填充中间训练方法,用于编码智能体基础模型,利用了函数调用与智能体动作-观察循环之间的结构相似性。该方法在SWE-Bench基准测试上,针对多种模型规模和训练后流水线均提升了性能。

0 人收藏 0 人点赞
#swe-bench

编程代理究竟需要什么上下文来执行操作?

arXiv cs.LG · 2026-07-14 缓存

本文研究了编程代理编辑代码所需的最小上下文,发现代码的自然语言摘要无效,且周围上下文影响不大,而压缩上下文仅用三分之一的令牌即可达到相同效果。同时,还揭示了因温度0 API推断而产生的噪声基底。

0 人收藏 0 人点赞
#swe-bench

先了解再修复:QA驱动的仓库知识获取用于软件问题解决

Hugging Face Daily Papers · 2026-07-13 缓存

ACQUIRE是一个QA驱动框架,它将知识获取与补丁生成解耦,用于软件问题解决,在SWE-bench Verified上优于预修复方法。

0 人收藏 0 人点赞
#swe-bench

@h100envy: 这篇论文彻底改变了我对自主工程智能体的看法:给智能体一个界面,而不是bash -> ...

X AI KOLs Timeline · 2026-07-11 缓存

本文介绍了针对自主编码智能体的智能体-计算机接口(ACI),用专为导航、编辑和反馈设计的命令取代原始bash,在SWE-bench和HumanEvalFix上取得了最先进的结果。

0 人收藏 0 人点赞
#swe-bench

@Azaliamirh: 看看TRACE,这是一种新的自我改进方法,代理识别自身失败背后缺少的能力并自我训练以解决这些问题……

X AI KOLs Timeline · 2026-07-09 缓存

TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。

0 人收藏 0 人点赞
#swe-bench

@OpenAI: 为了审计SWE-Bench Pro,我们使用了基于模型的调查代理以及来自五位独立专家的独立评审…

X AI KOLs · 2026-07-08 缓存

OpenAI 描述了对 SWE-Bench Pro 的审计过程,使用了基于模型的调查代理和来自经验丰富的软件工程师的独立评审,以确保在大规模下的全面评估。

0 人收藏 0 人点赞
#swe-bench

@OpenAI: 我们审计了SWE-Bench Pro,这是最广泛使用的AI编程基准之一,发现它已无法可靠地衡量前沿…

X AI KOLs · 2026-07-08 缓存

OpenAI审计了SWE-Bench Pro编码基准,发现约30%的任务存在故障,因此撤回了此前将其作为主要编码评估的建议。

0 人收藏 0 人点赞
#swe-bench

在编码评估中分离信号与噪声

Hacker News Top · 2026-07-08 缓存

OpenAI 对编码基准 SWE-Bench Pro 进行了审计,发现约 30% 的任务因测试过于严格和提示不够明确等问题而存在缺陷,建议模型开发者仔细检查结果。

0 人收藏 0 人点赞
#swe-bench

Hy3 基准测试综述:从 SWE-Bench Pro 到 312 个真实工作流任务

Reddit r/singularity · 2026-07-07

基准测试综述,涵盖 SWE-Bench Pro 和 312 个真实工作流任务,可能用于评估人工智能在软件工程挑战中的表现。

0 人收藏 0 人点赞
#swe-bench

SWE-Review:通过智能体代码审查实现问题解决的闭环

Hugging Face Daily Papers · 2026-07-07 缓存

本文介绍了SWE-Review,这是一个通过迭代的智能体审查和修订循环来闭环AI生成的拉取请求的框架,从而提高了代码质量和问题解决能力。实验结果表明,它优于单轮审查,并实现了有效的测试时扩展。

0 人收藏 0 人点赞
#swe-bench

具有随时有效证书的自演化代理

arXiv cs.AI · 2026-07-02 缓存

本文介绍了SEA,一种用于自演化代理的架构,它将自我修改限制在转向适配器和围绕冻结基础模型的版本化框架上,并使用随时有效门(anytime-valid gates)来根据固定错误预算审计修改。在SWE-bench Verified上使用四个基础模型进行的实验表明,该套件在强基础模型上提供了+4%到+5%的提升,同时防止了性能回退。

0 人收藏 0 人点赞
#swe-bench

Senior SWE-Bench:评估作为高级工程师的AI代理的开源基准

Hacker News Top · 2026-07-02 缓存

Senior SWE-Bench 是一个开源基准,用于评估AI代理在需要高级技能的软件工程任务上的表现。

0 人收藏 0 人点赞
#swe-bench

SWE-rebench 排行榜更新:GLM-5.2、Qwen3.6-27B、Qwen3.6-35B-A3B、Gemma 4 31B 等新模型 + 改进的 UI

Reddit r/LocalLLaMA · 2026-07-01 缓存

SWE-rebench 排行榜已更新,新增了 GLM-5.2、Qwen3.6、Gemma 4 31B 等模型,并改进了 UI,展示了软件工程任务上的性能排名。

0 人收藏 0 人点赞
#swe-bench

@nathanhabib1011: SWE-bench_pro 上参数低于 128B 的最佳模型… @Alibaba_Qwen 3.6 27b 依然疯狂,紧随其后的是 @ornith_ 35B

X AI KOLs Following · 2026-06-30 缓存

推文突出了 SWE-bench_pro 基准测试中参数低于 128B 的顶级 AI 模型,指出阿里 Qwen 3.6 27B 和 ornith 35B 是领先的竞争者。

0 人收藏 0 人点赞
#swe-bench

@no_stp_on_snek: 有人会晃着成绩卡对我说:9B模型在编程基准测试中碾压了它的基础模型(SWE-bench 69 vs 53)。确实如此。但关于……

X AI KOLs Following · 2026-06-28 缓存

一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。

0 人收藏 0 人点赞
#swe-bench

GitHub:我们将 GitHub Copilot 的代理工具套件与原生搭载领先模型的工具套件进行了基准测试。在保持…

X AI KOLs Following · 2026-06-28 缓存

GitHub 对自家 Copilot 的代理工具套件与模型供应商的工具套件进行了基准测试,发现在多个基准测试中,任务解决能力相当,但使用的 token 更少,突显了 Copilot 支持超过 20 个模型的特点。

0 人收藏 0 人点赞
#swe-bench

@HowToPrompt__: 这绝对是违法的。有人用纯Python完整重现了Claude Code,并免费发布到了GitHub上。→ 运行于任何模型…

X AI KOLs Timeline · 2026-06-28 缓存

一个完全开源的Claude Code Python复制版已在GitHub上发布,支持多种模型(如GPT、Gemini),在SWE-bench Verified上达到58.2%的成绩,并号称比原版便宜6倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈