标签
作者讨论了AI模型需要更好的世界知识,利用N-gram技术将更多知识融入更小的模型,并质疑为什么开发更侧重于编码能力而非更广泛的世界知识。
某开发者提出一种工作流程:使用昂贵的AI模型进行规划,搭配廉价或开源模型处理编码任务。研究表明,只要提供清晰的规格说明,不同模型间的质量差距就会缩小,使得开发成本几乎趋近于零。
LoopArena 将模型作为编码任务的运行时控制器进行基准测试,揭示即使 GPT-5.5 也仅达到 24.69% 的成功率,强调了代理系统中需要更好的控制机制。
一条推文评论说,谷歌需要在前沿编码方面迎头赶上才能保持竞争力,而Demis Hassabis则专注于基础研究,比如用于长期目标的世界模型。
Slipstream 通过从SSD而非RAM流式传输MoE专家权重,使得在36 GB MacBook上运行大型编码模型(35B–480B)成为可能。基准测试显示,35B模型约13–19 tok/s,118B模型约2.8 tok/s,并诚实报告了失败的方法。
一条推文强调了PoolsideAI非同寻常的开放性,称赞他们发布了一个小型编码模型、发表了论文以及完整的评估数据集,为AI领域的透明度树立了标准。
ClinePass 是一项每月10美元的订阅服务,提供精选的开源权重编码模型(GLM 5.2、Kimi k2.7-code、DeepSeek V4 Pro 等),用于 Cline CLI 和 IDE 中,享受折扣价。
Gergely Orosz 的一条推测性推文探讨了如果美国禁止最强大的编码模型(Fable/GPT-5.6)可能产生的影响,指出企业将转向下一个最佳开源模型(GLM-5.2),通过推理提供商获得更便宜且更优的选择。
GLM-5.2是一个新的开源编码模型,已经赶上了闭源SOTA模型,可能扰乱OpenAI和Anthropic的收入。
DeepReinforce 开源了 Ornith-1.0,这是一系列自我改进的编程模型,参数从 9B 到 397B 不等,基于 Gemma 4 和 Qwen 3.5 基础模型训练,采用了一种新颖的强化学习方法,能够学习生成自己的脚手架。
个人基准显示:Gemma-4E4B 在路由任务上称王,Qwen-3.6 27/30B 编码力压 Gemma-4,而 MiniMax M2.7 MXFP4 在 OpenCode 的 llama-swap 工作流中取代巨型 Qwen-3.5 量化模型。
来源:[Google Creates Strike Team to Improve Coding Models — The Information](https://www.theinformation.com/articles/google-creates-strike-team-improve-coding-models)
OpenAI宣布将不再报告SWE-bench Verified分数,理由是两个关键问题:59.4%的失败问题存在有缺陷的测试用例,这些用例拒绝了正确的解决方案;此外,前沿模型在训练过程中已经见过基准测试问题,使得改进更多地反映了训练数据的暴露而非真实能力提升。