swe-bench

标签

Cards List
#swe-bench

死循环并非模型不聪明,而是会话记录在暗中作祟

Reddit r/AI_Agents · 4天前

本文指出,AI代理常因模型的无状态特性和会话模式而陷入循环,并非因为模型笨拙。文章提出如硬预算和指纹技术等解决方案以打破这种循环。

0 人收藏 0 人点赞
#swe-bench

我在SWE-bench Verified Mini(50个任务)上基准测试了Ox Alpha:96%的问题已解决。现在我对自己产生了怀疑。

Reddit r/LocalLLaMA · 2026-08-21

作者在SWE-bench Verified Mini上对Ox Alpha进行了基准测试,达到了96%的解决率,但对分数的有效性提出了担忧,原因包括数据污染、小样本量和不可比较的基线。

0 人收藏 0 人点赞
#swe-bench

崎岖前沿:评估代码代理对语义保持转换的鲁棒性

arXiv cs.AI · 2026-08-20 缓存

本文评估了当代码库受到语义保持转换干扰时,AI代码代理的鲁棒性,揭示了一个崎岖的前沿,其中模型性能在不同的框架和基准测试中不可预测地变化。

0 人收藏 0 人点赞
#swe-bench

@omarsar0:微软的这项新工作非常有趣。(收藏起来)这项工作与利用工具进行模型后训练的新兴主题相关…

X AI KOLs Timeline · 2026-08-19 缓存

Agent Lightning v1.0 是微软推出的一个轻量级框架,它将代理工具与强化学习训练相结合,利用适度计算资源提高了 Qwen3.5-9B 在 SWE-bench Verified 上的性能。

0 人收藏 0 人点赞
#swe-bench

Agent Lightning v1.0:迈向受控的代理强化学习

Hugging Face Daily Papers · 2026-08-18 缓存

Agent Lightning v1.0 是一个轻量级框架,为代理环境启用可重现的强化学习,显著提升编码代理在如SWE-bench Verified等基准测试上的性能。

0 人收藏 0 人点赞
#swe-bench

试试 Benzi — 一个通过 _查询_ 而非读取来理解代码库的编程代理

Reddit r/AI_Agents · 2026-08-17

Benzi 是一个编程代理,通过查询代码库来理解和编写代码,在 SWE-bench Verified 上达到了 77.4% 的准确率,成本低于 30 美元,并且与模型无关。

0 人收藏 0 人点赞
#swe-bench

@joelniklaus: Codex 对大型模型过度优化:在 GLM 5.2 的 10 个框架中排名第 2,但在 Gemma-4 上跌至第 9!几乎……

X AI KOLs Timeline · 2026-08-07 缓存

一项在 SWE-bench Pro 上比较 10 种编码智能体框架(harness)的研究表明,框架选择会显著影响 pass@1 和成本,并揭示厂商提供的框架对大型模型过拟合,无法迁移到较小的模型。

0 人收藏 0 人点赞
#swe-bench

@LangChain:“芯片设计中的很多瓶颈实际上是热问题。”@cognition 总裁 @russelljkaplan 谈及特斯拉之争……

X AI KOLs Timeline · 2026-08-06 缓存

Cognition 总裁 Russell Kaplan 在播客中回顾了编码智能体 Devon 的发展,介绍新评估 Frontier Code 衡量“可合并性”,并讨论模型选择、成本与速度取代能力成为关键关注点。

0 人收藏 0 人点赞
#swe-bench

SWE-Touch:当用户修改代码时对编码智能体的基准测试

Hugging Face Daily Papers · 2026-08-03 缓存

介绍了SWE-Touch,一个基准测试框架,它在智能体编码轨迹中注入与用户冲突的编辑,结果表明,尽管当前编码智能体在独立基准测试中表现强劲,但在协作场景中性能显著下降。

0 人收藏 0 人点赞
#swe-bench

Ramp SWE-Bench(3分钟阅读)

TLDR AI · 2026-08-03

Ramp 构建了一个私有基准,包含80个生产后端任务,用于评估AI编程代理生成的、可直接评审的补丁,揭示了准确性、延迟和成本之间的权衡,同时避免了公共基准的污染。

0 人收藏 0 人点赞
#swe-bench

你的编程智能体可能在你的基准测试中作弊

Reddit r/AI_Agents · 2026-07-29

对16个智能体配置下的340个实现进行审计发现,14%的智能体访问了本不应看到的答案,导致基准测试结果出现偏差。该问题是在Grok 4.5在自定义SWE-bench上得分异常高时被发现的。

0 人收藏 0 人点赞
#swe-bench

@cline: Claude Opus 5 在 SWE-Bench 上以 97% 的成绩排名第一,并声称以半价提供 Fable 5 级别的智能。令人难以置信的是,在……

X AI KOLs Timeline · 2026-07-24 缓存

Anthropic 发布了 Claude Opus 5,该模型在 SWE-Bench 上取得了 97% 的成绩,并声称以一半的价格提供 Fable 5 级别的智能,展示了 SOTA 的快速提升。

0 人收藏 0 人点赞
#swe-bench

我在swe-verified基准测试子集上比较了本地模型的不同量化级别和配置

Reddit r/LocalLLaMA · 2026-07-23

在SWE-verified基准测试的子集上,对具有不同量化级别和配置的本地AI模型进行比较,评估性能差异。

0 人收藏 0 人点赞
#swe-bench

SWE-Pruner Pro:编程大语言模型早已知道该修剪什么

Hugging Face Daily Papers · 2026-07-20 缓存

SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。

0 人收藏 0 人点赞
#swe-bench

@thesupermanmx: 中国刚刚改变了游戏规则。他们发布了一个开源模型,仅消耗你们最喜欢的美国模型1%的token…

X AI KOLs Timeline · 2026-07-15 缓存

中国发布了Ling-2.6-1T,一个1万亿参数的开源模型,在256K上下文窗口中SWE-bench上达到72.2%,声称高效且兼容Claude Code。

0 人收藏 0 人点赞
#swe-bench

你只需要前沿模型进行单次编辑

Hacker News Top · 2026-07-15 缓存

一篇博客文章认为,仅使用前沿模型进行规划,而使用更便宜的模型执行,这种做法并不划算,因为读取(而非编辑)才是主要的成本驱动因素;重复读取会抵消任何节省。

0 人收藏 0 人点赞
#swe-bench

面向函数的中间填充作为编码智能体基础模型的中间训练

arXiv cs.AI · 2026-07-15 缓存

本文提出了一种面向函数的中间填充中间训练方法,用于编码智能体基础模型,利用了函数调用与智能体动作-观察循环之间的结构相似性。该方法在SWE-Bench基准测试上,针对多种模型规模和训练后流水线均提升了性能。

0 人收藏 0 人点赞
#swe-bench

编程代理究竟需要什么上下文来执行操作?

arXiv cs.LG · 2026-07-14 缓存

本文研究了编程代理编辑代码所需的最小上下文,发现代码的自然语言摘要无效,且周围上下文影响不大,而压缩上下文仅用三分之一的令牌即可达到相同效果。同时,还揭示了因温度0 API推断而产生的噪声基底。

0 人收藏 0 人点赞
#swe-bench

先了解再修复:QA驱动的仓库知识获取用于软件问题解决

Hugging Face Daily Papers · 2026-07-13 缓存

ACQUIRE是一个QA驱动框架,它将知识获取与补丁生成解耦,用于软件问题解决,在SWE-bench Verified上优于预修复方法。

0 人收藏 0 人点赞
#swe-bench

@h100envy: 这篇论文彻底改变了我对自主工程智能体的看法:给智能体一个界面,而不是bash -> ...

X AI KOLs Timeline · 2026-07-11 缓存

本文介绍了针对自主编码智能体的智能体-计算机接口(ACI),用专为导航、编辑和反馈设计的命令取代原始bash,在SWE-bench和HumanEvalFix上取得了最先进的结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈