推介 SWE-Lancer 基准测试
摘要
OpenAI 推出 SWE-Lancer,这是一个包含超过 1,400 个来自 Upwork 的真实自由职业软件工程任务的基准测试,这些任务价值 100 万美元,旨在评估 AI 模型在实际工程工作中的性能,并将模型能力映射到经济价值。
查看缓存全文
缓存时间: 2026/04/20 14:57
相似文章
Senior SWE Bench:一个专注于现实未充分指定功能任务的新基准测试
Senior SWE-Bench 是一个新的开源基准测试,旨在评估 AI 智能体在现实、未充分指定的软件工程任务上的表现,强调意图对齐和代码质量等技能,而非过于详细的规范。
介绍 SWE-bench Verified
# 介绍 SWE-bench Verified 来源: [https://openai.com/index/introducing-swe-bench-verified/](https://openai.com/index/introducing-swe-bench-verified/) 我们发布了 SWE-bench 的人工验证子集,能更可靠地评估 AI 模型解决实际软件问题的能力。*更新于 2025 年 2 月 24 日* 作为我们[准备框架](https://openai.com/preparedness/)的一部分,OpenAI 开发了一系列指标来追踪、评估和预测模型的自主行动能力
Senior SWE-Bench:评估作为高级工程师的AI代理的开源基准
Senior SWE-Bench 是一个开源基准,用于评估AI代理在需要高级技能的软件工程任务上的表现。
Hy3 基准测试综述:从 SWE-Bench Pro 到 312 个真实工作流任务
基准测试综述,涵盖 SWE-Bench Pro 和 312 个真实工作流任务,可能用于评估人工智能在软件工程挑战中的表现。
有人对新DeepSWE进行了审计,结果不太好看
DeepSWE是一个新的基准测试,用于评估AI编程代理在来自活跃开源仓库的真实软件工程任务上的表现,包含113个任务,涵盖TypeScript、Go、Python、JavaScript和Rust,提供隔离环境和基于程序的验证器。