coding-benchmark

标签

Cards List
#coding-benchmark

在我的编码代理上,一个35B模型以95%对53%击败了120B模型。构建你自己的基准测试。

Reddit r/AI_Agents ↗ · 2026-09-26

一位开发者为编码AI代理构建了自定义基准测试,并发现当测试框架优化时,一个35B参数模型优于120B参数模型,凸显了定制化评估相对于通用规格的重要性。

0 人收藏 0 人点赞
#coding-benchmark

Qwen3.8-Max-0902 在编码领域超越 Claude Opus 5

Reddit r/singularity ↗ · 2026-09-02 缓存

Qwen3.8-Max-0902 在 Code Arena: WebDev 中以 1691 分首次亮相排名第一,超越 Claude Opus 5 3 分,并以每百万代币 5 美元的价格占据了 Pareto frontier 上的最高分位置。

0 人收藏 0 人点赞
#coding-benchmark

@Suhail: 看到基准测试朝着这个方向发展并不断进步,感到非常兴奋!

X AI KOLs Timeline ↗ · 2026-09-02 缓存

Proximal 发布了 FrontierSWE v2,这是一个更新的超长期编码基准测试,具有扩展的任务和改进的方法,突出了 Claude Fable 5.1 领先的巨大性能差距。

0 人收藏 0 人点赞
#coding-benchmark

@Yuchenj_UW:GLM-5.3 达到 310 token/s!Databricks 推理速度和延迟再次位居第一。在我们的内部 Databricks 编程基准测试中……

X AI KOLs Following ↗ · 2026-09-02 缓存

GLM-5.3 在 Databricks 推理平台上达到每秒 310 token 的速度,在速度和延迟方面均处于领先地位,并且是最强的编程开源模型,可与 Fable 5 和 Opus 4.8 竞争。

0 人收藏 0 人点赞
#coding-benchmark

Terminal-Bench-LILT:基于语言、地区和文化的多语言代理编码基准

arXiv cs.CL ↗ · 2026-09-01 缓存

Terminal-Bench-LILT 呈现一个多语言编码基准,包含300个真实任务,涵盖10种语言,揭示了AI模型在处理非英语问题(如国际化和文化惯例)上的不足。

0 人收藏 0 人点赞
#coding-benchmark

你认为几个通义千问3.8-27B模型协作能在LiveCodeBench Hard上达到与Fable-5相当的分数吗?

Reddit r/LocalLLaMA ↗ · 2026-08-28

一项新论文声称,多个通义千问3.8-27B模型组成的集成系统在LiveCodeBench上达到了与Fable-5相当的编码性能,且成本可能显著降低。

0 人收藏 0 人点赞
#coding-benchmark

Qwen 3.8 27B 在 Code Arena 排名第9。Gemma 4 31B 排名第80。

Reddit r/LocalLLaMA ↗ · 2026-08-24 缓存

阿里巴巴 Qwen 的 Qwen3.8-27B 在 Code Arena 基准测试中以 1595 分获得第9名,超越了 Gemma 4-31B 等更大模型,并重塑了编码性能的帕累托前沿。

0 人收藏 0 人点赞
#coding-benchmark

Schrödinger的代码仓库:LLM 是学会了 SWE-bench 还是记忆了它?

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

本文提出了 Schrödinger Repo,一个用于编码代理的评估框架,它动态实例化仓库以解决基准测试中的数据泄露问题,表明当前的 LLM 可能依赖于记忆的线索。

0 人收藏 0 人点赞
#coding-benchmark

GLM 5.3 SlopCodeBench 成绩

Reddit r/LocalLLaMA ↗ · 2026-08-20

GLM 5.3 在 SlopCodeBench 上的基准测试结果显示,它在某子集上得分47.1%,在另一子集上与 Fable 5 和 GPT-5.6 Sol 并列,表明所有模型都在这个未饱和的编程基准上遇到困难。

0 人收藏 0 人点赞
#coding-benchmark

ProgramBench Vetted:从可运行二进制文件进行逆向工程

Hacker News Top ↗ · 2026-08-20 缓存

ProgramBench Vetted 是一个包含50个任务的基准,用于评估AI代理从可运行二进制文件重构程序的能力,旨在研究长上下文协调并为强化学习提供密集奖励。

0 人收藏 0 人点赞
#coding-benchmark

本地 Qwen 3.8 27B 对比 GPT-5.6 Terra 与 Grok 4.6

Reddit r/artificial ↗ · 2026-08-18

本文对比了三个AI模型——Qwen 3.8 27B、GPT-5.6 Terra和Grok 4.6——在构建Three.js香水发布网站方面的能力,详细阐述了它们的实施优势和潜在问题。

0 人收藏 0 人点赞
#coding-benchmark

@Redpoint:为什么一个费用管理平台要成立自己的AI研究实验室?@karimatiyeh 将 @RampLabs 描述为“一群……

X AI KOLs Following ↗ · 2026-08-07 缓存

Ramp 是一个费用管理平台,一年前推出了自己的 AI 研究实验室 Ramp Labs。该实验室开展过多个项目,例如构建以生产环境为基准的编码基准测试“Ramp SWE-Bench”、将 Claude Code 整合进《过山车大亨》,以及一个机制可解释性游乐场。

0 人收藏 0 人点赞
#coding-benchmark

@GoSailGlobal: 今天8月3号,阿里正式发了Qwen3.8 2.4万亿参数,1M上下文,编程和办公能力这一版提升很猛,整体挤进全球第一梯队 预览版跑了两周,今天正式毕业 我第一时间拿它做了个硬核实测,先把结论和过程摊开 我出了一道挺狠的题:单文件HTML手…

X AI KOLs Timeline ↗ · 2026-08-03 缓存

阿里正式发布Qwen3.8,拥有2.4万亿参数和1M上下文,编程和办公能力大幅提升,进入全球第一梯队。作者用单文件HTML N-body模拟对其进行了硬核实测。

0 人收藏 0 人点赞
#coding-benchmark

@omarsar0:这款 DeepSeek-V4-Flash-High 模型在前端方面极其出色。我进行了一些测试,不得不再次确认我用的模型是否正确……

X AI KOLs Following ↗ · 2026-08-01 缓存

DeepSeek-V4-Flash-High 以 1586 分的成绩在 Frontend Code Arena 中位居榜首,以每百万 token 仅 $0.14/$0.28 的价格提供最佳性能价格比。

0 人收藏 0 人点赞
#coding-benchmark

Inkling-Small-276B-12B(effort "max")对比 Qwen3.6-27B

Reddit r/LocalLLaMA ↗ · 2026-07-30

一位 Reddit 用户在复杂编码任务上比较了 Inkling-Small-276B-12B 和 Qwen3.6-27B,发现 Qwen 有条不紊地规划和审查其代码,而 Inkling 在经过长时间推理后生成了拼凑式的代码。

0 人收藏 0 人点赞
#coding-benchmark

@_philschmid: https://x.com/_philschmid/status/2081744861829414977

X AI KOLs Timeline ↗ · 2026-07-27 缓存

EvoCode-Bench 是一个多轮编码基准,包含 5 个领域的 26 个任务,旨在评估 AI 代理在持续演变规格和累积测试下的表现,揭示单轮得分会严重高估可靠性。

0 人收藏 0 人点赞
#coding-benchmark

Laguna S 2.1 发布:比 Deepseek v4 Flash 更便宜,比 V4 Pro 更优

Reddit r/LocalLLaMA ↗ · 2026-07-21 缓存

Poolside 发布 Laguna S 2.1,这是一个 118B MoE 模型,每个 token 激活 8B 参数,针对智能体编码进行了优化。据称,其性能优于 DeepSeek V4 Pro,同时价格低于 DeepSeek V4 Flash,拥有 1M 上下文窗口和开源许可证。

0 人收藏 0 人点赞
#coding-benchmark

Google 发布 Gemini 3.6 Flash 与网络安全 AI,预告 3.5 Pro 和 Gemini 4

Ars Technica ↗ · 2026-07-21 缓存

Google 宣布推出 Gemini 3.6 Flash,其编码效率提升且令牌成本降低,同时发布 Gemini 3.5 Flash Lite 和一款专注于网络安全的模型,而 Gemini 3.5 Pro 仍在开发中,并暗示了 Gemini 4。

0 人收藏 0 人点赞
#coding-benchmark

Kimi K3 在 Frontend Code Arena 基准测试中位列第一

Reddit r/singularity ↗ · 2026-07-16

Kimi K3 在 Frontend Code Arena 基准测试中取得最高排名,展现出强大的编码能力。

0 人收藏 0 人点赞
#coding-benchmark

GPT-5.6, Grok 4.5, Claude 和 Muse Spark 构建相同的4个应用

Hacker News Top ↗ · 2026-07-10 缓存

对十二个AI模型的详细比较,包括GPT-5.6、Grok 4.5、Claude以及开放权重模型,被要求多次尝试构建四个不同的应用程序,所有成果均已公开以供独立评估。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈