coding-models

标签

Cards List
#coding-models

Ngram与世界知识——为什么我们只在构建编码模型?

Reddit r/LocalLLaMA ↗ · 2026-09-22

作者讨论了AI模型需要更好的世界知识,利用N-gram技术将更多知识融入更小的模型,并质疑为什么开发更侧重于编码能力而非更广泛的世界知识。

0 人收藏 0 人点赞
#coding-models

开源编码模型越来越强大——开发如今几乎可以免费实现

Reddit r/ArtificialInteligence ↗ · 2026-09-12

某开发者提出一种工作流程:使用昂贵的AI模型进行规划,搭配廉价或开源模型处理编码任务。研究表明,只要提供清晰的规格说明,不同模型间的质量差距就会缩小,使得开发成本几乎趋近于零。

0 人收藏 0 人点赞
#coding-models

@rohanpaul_ai: 如果管理工作的模型不知道何时重定向、验证或停止,那么强大的编码模型也是不够的。Loop…

X AI KOLs Following ↗ · 2026-09-03 缓存

LoopArena 将模型作为编码任务的运行时控制器进行基准测试,揭示即使 GPT-5.5 也仅达到 24.69% 的成功率,强调了代理系统中需要更好的控制机制。

0 人收藏 0 人点赞
#coding-models

@danshipper:线索:为了在今天保持竞争力,谷歌需要在前沿编码方面迎头赶上。Demis相信不同的基础研究方向…

X AI KOLs Timeline ↗ · 2026-08-05 缓存

一条推文评论说,谷歌需要在前沿编码方面迎头赶上才能保持竞争力,而Demis Hassabis则专注于基础研究,比如用于长期目标的世界模型。

0 人收藏 0 人点赞
#coding-models

使用多种编码模型开发开源静态AI代理能力与风险分析器

Reddit r/AI_Agents ↗ · 2026-07-26

描述了开发一个开源静态分析器的过程,该分析器利用多种编码模型来评估AI代理的能力和风险。

0 人收藏 0 人点赞
#coding-models

我通过从SSD流式传输MoE专家权重,在36 GB MacBook上运行35B–480B编码模型——自包含应用,并且我也公开了那些*失败*的基准测试

Reddit r/LocalLLaMA ↗ · 2026-07-25

Slipstream 通过从SSD而非RAM流式传输MoE专家权重,使得在36 GB MacBook上运行大型编码模型(35B–480B)成为可能。基准测试显示,35B模型约13–19 tok/s,118B模型约2.8 tok/s,并诚实报告了失败的方法。

0 人收藏 0 人点赞
#coding-models

@swyx: 我认为人们对@poolsideai的开放程度不够重视——不仅他们…

X AI KOLs Timeline ↗ · 2026-07-23 缓存

一条推文强调了PoolsideAI非同寻常的开放性,称赞他们发布了一个小型编码模型、发表了论文以及完整的评估数据集,为AI领域的透明度树立了标准。

0 人收藏 0 人点赞
#coding-models

@heyshrutimishra: 如今好模型随处可见。运行它们才是难点。ClinePass 每月10美元,提供精选的最佳开源权重编码模型…

X AI KOLs Following ↗ · 2026-06-29 缓存

ClinePass 是一项每月10美元的订阅服务,提供精选的开源权重编码模型(GLM 5.2、Kimi k2.7-code、DeepSeek V4 Pro 等),用于 Cline CLI 和 IDE 中,享受折扣价。

0 人收藏 0 人点赞
#coding-models

@GergelyOrosz:当最强大的编码模型(Fable / GPT-5.6)被美国政府禁止时,而下一个最强大的……

X AI KOLs Following ↗ · 2026-06-28 缓存

Gergely Orosz 的一条推测性推文探讨了如果美国禁止最强大的编码模型(Fable/GPT-5.6)可能产生的影响,指出企业将转向下一个最佳开源模型(GLM-5.2),通过推理提供商获得更便宜且更优的选择。

0 人收藏 0 人点赞
#coding-models

@GergelyOrosz:这来自一个流行的推理提供商GLM-5.2,加上美国禁止最新最强大的模型意味着开源已经赶上了…

X AI KOLs Following ↗ · 2026-06-27 缓存

GLM-5.2是一个新的开源编码模型,已经赶上了闭源SOTA模型,可能扰乱OpenAI和Anthropic的收入。

0 人收藏 0 人点赞
#coding-models

DeepReinforce 发布 Ornith-1.0 开源编程模型(2分钟阅读)

TLDR AI ↗ · 2026-06-26 缓存

DeepReinforce 开源了 Ornith-1.0,这是一系列自我改进的编程模型,参数从 9B 到 397B 不等,基于 Gemma 4 和 Qwen 3.5 基础模型训练,采用了一种新颖的强化学习方法,能够学习生成自己的脚手架。

0 人收藏 0 人点赞
#coding-models

Gemma 4 击败 Qwen 3.5(更新),Qwen 3.6 27B + MiniMax M2.7 是最佳 OpenCode 组合

Reddit r/LocalLLaMA ↗ · 2026-04-23

个人基准显示:Gemma-4E4B 在路由任务上称王,Qwen-3.6 27/30B 编码力压 Gemma-4,而 MiniMax M2.7 MXFP4 在 OpenCode 的 llama-swap 工作流中取代巨型 Qwen-3.5 量化模型。

0 人收藏 0 人点赞
#coding-models

面对Anthropic压力,Google加码推进智能体AI

Reddit r/singularity ↗ · 2026-04-20

来源:[Google Creates Strike Team to Improve Coding Models — The Information](https://www.theinformation.com/articles/google-creates-strike-team-improve-coding-models)

0 人收藏 0 人点赞
#coding-models

为何我们不再评估SWE-bench Verified

OpenAI Blog ↗ · 2026-02-23 缓存

OpenAI宣布将不再报告SWE-bench Verified分数,理由是两个关键问题:59.4%的失败问题存在有缺陷的测试用例,这些用例拒绝了正确的解决方案;此外,前沿模型在训练过程中已经见过基准测试问题,使得改进更多地反映了训练数据的暴露而非真实能力提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈