标签
SWE-Pruner Pro利用编程智能体自身的内部表示来修剪长代码上下文,可节省高达39%的令牌,同时保持或提升多轮基准测试中的任务性能。
中国发布了Ling-2.6-1T,一个1万亿参数的开源模型,在256K上下文窗口中SWE-bench上达到72.2%,声称高效且兼容Claude Code。
一篇博客文章认为,仅使用前沿模型进行规划,而使用更便宜的模型执行,这种做法并不划算,因为读取(而非编辑)才是主要的成本驱动因素;重复读取会抵消任何节省。
本文提出了一种面向函数的中间填充中间训练方法,用于编码智能体基础模型,利用了函数调用与智能体动作-观察循环之间的结构相似性。该方法在SWE-Bench基准测试上,针对多种模型规模和训练后流水线均提升了性能。
本文研究了编程代理编辑代码所需的最小上下文,发现代码的自然语言摘要无效,且周围上下文影响不大,而压缩上下文仅用三分之一的令牌即可达到相同效果。同时,还揭示了因温度0 API推断而产生的噪声基底。
ACQUIRE是一个QA驱动框架,它将知识获取与补丁生成解耦,用于软件问题解决,在SWE-bench Verified上优于预修复方法。
本文介绍了针对自主编码智能体的智能体-计算机接口(ACI),用专为导航、编辑和反馈设计的命令取代原始bash,在SWE-bench和HumanEvalFix上取得了最先进的结果。
TRACE是一种新的自我改进方法,AI代理识别自身失败背后缺少的能力,并自我训练以解决这些问题。经过TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,以更少的训练次数超越了更大的模型。
OpenAI 描述了对 SWE-Bench Pro 的审计过程,使用了基于模型的调查代理和来自经验丰富的软件工程师的独立评审,以确保在大规模下的全面评估。
OpenAI审计了SWE-Bench Pro编码基准,发现约30%的任务存在故障,因此撤回了此前将其作为主要编码评估的建议。
OpenAI 对编码基准 SWE-Bench Pro 进行了审计,发现约 30% 的任务因测试过于严格和提示不够明确等问题而存在缺陷,建议模型开发者仔细检查结果。
基准测试综述,涵盖 SWE-Bench Pro 和 312 个真实工作流任务,可能用于评估人工智能在软件工程挑战中的表现。
本文介绍了SWE-Review,这是一个通过迭代的智能体审查和修订循环来闭环AI生成的拉取请求的框架,从而提高了代码质量和问题解决能力。实验结果表明,它优于单轮审查,并实现了有效的测试时扩展。
本文介绍了SEA,一种用于自演化代理的架构,它将自我修改限制在转向适配器和围绕冻结基础模型的版本化框架上,并使用随时有效门(anytime-valid gates)来根据固定错误预算审计修改。在SWE-bench Verified上使用四个基础模型进行的实验表明,该套件在强基础模型上提供了+4%到+5%的提升,同时防止了性能回退。
Senior SWE-Bench 是一个开源基准,用于评估AI代理在需要高级技能的软件工程任务上的表现。
SWE-rebench 排行榜已更新,新增了 GLM-5.2、Qwen3.6、Gemma 4 31B 等模型,并改进了 UI,展示了软件工程任务上的性能排名。
推文突出了 SWE-bench_pro 基准测试中参数低于 128B 的顶级 AI 模型,指出阿里 Qwen 3.6 27B 和 ornith 35B 是领先的竞争者。
一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。
GitHub 对自家 Copilot 的代理工具套件与模型供应商的工具套件进行了基准测试,发现在多个基准测试中,任务解决能力相当,但使用的 token 更少,突显了 Copilot 支持超过 20 个模型的特点。
一个完全开源的Claude Code Python复制版已在GitHub上发布,支持多种模型(如GPT、Gemini),在SWE-bench Verified上达到58.2%的成绩,并号称比原版便宜6倍。