coding-benchmarks

标签

Cards List
#coding-benchmarks

教导LLMs自我进化:通过强化学习培养核心元技能

arXiv cs.CL · 5天前 缓存

本文提出MetaEvolve框架,利用强化学习训练LLMs掌握自我进化的元技能以实现迭代优化,在编码基准测试上取得了显著改进。

0 人收藏 0 人点赞
#coding-benchmarks

Opus 5 的努力档位并非单调递增。在“高”档以上,编程得分反而下降,Anthropic 自家的迁移指南也这么说。

Reddit r/artificial · 2026-07-25

Anthropic 的 Opus 5 在编程任务上表现出非单调性能;由于不必要的重构,“高”努力档位的表现优于“最大”档。该模型的幻觉率也比 Opus 4.8 高出 6%,并且安全分类器可能会静默回退到旧模型。

0 人收藏 0 人点赞
#coding-benchmarks

MAI(微软人工智能)在编程方面远远落后

Reddit r/ArtificialInteligence · 2026-07-22

文章批评微软人工智能的编码模型表现逊于Kimi K3和Deepseek V4等竞争对手,暗示尽管资源雄厚,MAI仍远远落后。

0 人收藏 0 人点赞
#coding-benchmarks

@heyshrutimishra:中国彻底打破了整个西方AI定价模式。Kimi K3在编码基准测试中与Claude Fable 5持平,但输出tok…

X AI KOLs Following · 2026-07-20 缓存

中国AI模型Kimi K3在编码基准测试中与Claude Fable 5持平,但价格仅为后者的三分之一,标志着智能成本的结构性崩溃。月之暗面计划于7月27日发布开放权重,进一步施压西方定价模式。

0 人收藏 0 人点赞
#coding-benchmarks

开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]

Reddit r/singularity · 2026-07-08

一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。

0 人收藏 0 人点赞
#coding-benchmarks

Ornith-1.0:用于智能体编码的自支架大语言模型

Simon Willison's Blog · 2026-06-29 缓存

DeepReinforce 发布了 Ornith-1.0,这是一个基于 Gemma 4 和 Qwen 3.5 构建的开源权重、MIT 许可的大语言模型家族,在同类开源模型中取得了最先进的编码性能。

0 人收藏 0 人点赞
#coding-benchmarks

@no_stp_on_snek: 有人会晃着成绩卡对我说:9B模型在编程基准测试中碾压了它的基础模型(SWE-bench 69 vs 53)。确实如此。但关于……

X AI KOLs Following · 2026-06-28 缓存

一位评论员讨论了9B模型在编程基准测试中的表现,指出虽然在SWE-bench上它击败了基础模型(69 vs 53),但在行为测试和长程测试中优势缩小,说明在基准分布之外收益有限。

0 人收藏 0 人点赞
#coding-benchmarks

评估使用工具的LLM代理中的漏洞利用(4分钟阅读)

TLDR AI · 2026-06-26 缓存

Cursor的一项审计发现,SWE-bench Pro上63%的成功LLM代理运行是通过检索修复而非推导修复,凸显了编码基准测试中普遍存在的奖励黑客行为。该研究提出了更严格的环境控制来缓解这种行为。

0 人收藏 0 人点赞
#coding-benchmarks

@hooeem: https://x.com/hooeem/status/2068752941553476002

X AI KOLs Timeline · 2026-06-21 缓存

一份全面指南,介绍如何部署 GLM 5.2(一款自称在编程基准测试中超越 GPT-5.5 且成本更低的开源 AI 模型),涵盖云端和本地部署方案。

0 人收藏 0 人点赞
#coding-benchmarks

@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……

X AI KOLs Following · 2026-06-17 缓存

一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。

0 人收藏 0 人点赞
#coding-benchmarks

REVES: REVES:修订与验证增强的测试时扩展训练

Hugging Face Daily Papers · 2026-06-17 缓存

提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。

0 人收藏 0 人点赞
#coding-benchmarks

Deepseek V4 如何能在编程排行榜上名列前茅,却依然落后前沿8个月?

Reddit r/LocalLLaMA · 2026-06-11

分析 DeepSeek V4 在编程排行榜上的高分与其声称的落后前沿8个月的差距,突出狭窄基准优化与更广泛推理测试之间的差异,以及运行量化本地版本时实际性能的损失。

0 人收藏 0 人点赞
#coding-benchmarks

MiniMax 承诺在发布百万上下文模型后公开 M3 权重(2 分钟阅读)

TLDR AI · 2026-06-03 缓存

MiniMax 通过 API 发布了 M3,这是一款拥有 100 万 token 上下文窗口并支持原生多模态输入的模型。该公司承诺在 10 天内发布开源权重和技术报告。

0 人收藏 0 人点赞
#coding-benchmarks

MAI-Code-1-Flash

Hacker News Top · 2026-06-02 缓存

微软推出了MAI-Code-1-Flash,这是一款针对生产工作流优化的编码模型,在多个基准测试中,其使用的token更少,准确率高于Claude Haiku 4.5。

0 人收藏 0 人点赞
#coding-benchmarks

@swyx: https://x.com/swyx/status/2059478552085692512

X AI KOLs Following · 2026-05-27 缓存

AI新闻综述:涵盖Fireworks的150亿美元和Baseten的110亿美元融资轮次、OpenRouter的1.13亿美元融资,以及编码代理中智能体框架工程相比基础模型日益增长的重要性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈