标签
一位开发者为编码AI代理构建了自定义基准测试,并发现当测试框架优化时,一个35B参数模型优于120B参数模型,凸显了定制化评估相对于通用规格的重要性。
Qwen3.8-Max-0902 在 Code Arena: WebDev 中以 1691 分首次亮相排名第一,超越 Claude Opus 5 3 分,并以每百万代币 5 美元的价格占据了 Pareto frontier 上的最高分位置。
Proximal 发布了 FrontierSWE v2,这是一个更新的超长期编码基准测试,具有扩展的任务和改进的方法,突出了 Claude Fable 5.1 领先的巨大性能差距。
GLM-5.3 在 Databricks 推理平台上达到每秒 310 token 的速度,在速度和延迟方面均处于领先地位,并且是最强的编程开源模型,可与 Fable 5 和 Opus 4.8 竞争。
Terminal-Bench-LILT 呈现一个多语言编码基准,包含300个真实任务,涵盖10种语言,揭示了AI模型在处理非英语问题(如国际化和文化惯例)上的不足。
一项新论文声称,多个通义千问3.8-27B模型组成的集成系统在LiveCodeBench上达到了与Fable-5相当的编码性能,且成本可能显著降低。
阿里巴巴 Qwen 的 Qwen3.8-27B 在 Code Arena 基准测试中以 1595 分获得第9名,超越了 Gemma 4-31B 等更大模型,并重塑了编码性能的帕累托前沿。
本文提出了 Schrödinger Repo,一个用于编码代理的评估框架,它动态实例化仓库以解决基准测试中的数据泄露问题,表明当前的 LLM 可能依赖于记忆的线索。
GLM 5.3 在 SlopCodeBench 上的基准测试结果显示,它在某子集上得分47.1%,在另一子集上与 Fable 5 和 GPT-5.6 Sol 并列,表明所有模型都在这个未饱和的编程基准上遇到困难。
ProgramBench Vetted 是一个包含50个任务的基准,用于评估AI代理从可运行二进制文件重构程序的能力,旨在研究长上下文协调并为强化学习提供密集奖励。
本文对比了三个AI模型——Qwen 3.8 27B、GPT-5.6 Terra和Grok 4.6——在构建Three.js香水发布网站方面的能力,详细阐述了它们的实施优势和潜在问题。
Ramp 是一个费用管理平台,一年前推出了自己的 AI 研究实验室 Ramp Labs。该实验室开展过多个项目,例如构建以生产环境为基准的编码基准测试“Ramp SWE-Bench”、将 Claude Code 整合进《过山车大亨》,以及一个机制可解释性游乐场。
阿里正式发布Qwen3.8,拥有2.4万亿参数和1M上下文,编程和办公能力大幅提升,进入全球第一梯队。作者用单文件HTML N-body模拟对其进行了硬核实测。
DeepSeek-V4-Flash-High 以 1586 分的成绩在 Frontend Code Arena 中位居榜首,以每百万 token 仅 $0.14/$0.28 的价格提供最佳性能价格比。
一位 Reddit 用户在复杂编码任务上比较了 Inkling-Small-276B-12B 和 Qwen3.6-27B,发现 Qwen 有条不紊地规划和审查其代码,而 Inkling 在经过长时间推理后生成了拼凑式的代码。
EvoCode-Bench 是一个多轮编码基准,包含 5 个领域的 26 个任务,旨在评估 AI 代理在持续演变规格和累积测试下的表现,揭示单轮得分会严重高估可靠性。
Poolside 发布 Laguna S 2.1,这是一个 118B MoE 模型,每个 token 激活 8B 参数,针对智能体编码进行了优化。据称,其性能优于 DeepSeek V4 Pro,同时价格低于 DeepSeek V4 Flash,拥有 1M 上下文窗口和开源许可证。
Google 宣布推出 Gemini 3.6 Flash,其编码效率提升且令牌成本降低,同时发布 Gemini 3.5 Flash Lite 和一款专注于网络安全的模型,而 Gemini 3.5 Pro 仍在开发中,并暗示了 Gemini 4。
Kimi K3 在 Frontend Code Arena 基准测试中取得最高排名,展现出强大的编码能力。
对十二个AI模型的详细比较,包括GPT-5.6、Grok 4.5、Claude以及开放权重模型,被要求多次尝试构建四个不同的应用程序,所有成果均已公开以供独立评估。