coding-llms

标签

Cards List
#coding-llms

面向编程大语言模型中隐式软件世界模型的评估

arXiv cs.AI · 2026-06-29 缓存

本文提出评估编程大语言模型对软件执行的理解,超越控制流,包括预测内存使用、运行时间和分析器输出,发现所有测试模型表现不佳,表明缺乏对软件世界模型的深入理解。

0 人收藏 0 人点赞
#coding-llms

使用五款中文编码大模型一个月后,M3真的会登顶吗?

Reddit r/ArtificialInteligence · 2026-05-22

一位用户分享了一个月内在TypeScript/Next.js代码库上对五款中文编码大模型(Kimi K2.6、GLM-5.1、MiMo V2.5 Pro、MiniMax 2.7、DeepSeek V4 Pro)的比较,从前端、后端、代码审查、全能型和推理等类别进行评分。他们指出MiniMax 2.7以约7%的成本实现了Opus 4.6约90%的质量,并推测即将推出的MiniMax 3.0是否会弥补规划和测试覆盖方面的不足,从而登上榜首。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈