标签
DeepReinforce 开源了 Ornith-1.0,这是一系列自我改进的编程模型,参数从 9B 到 397B 不等,基于 Gemma 4 和 Qwen 3.5 基础模型训练,采用了一种新颖的强化学习方法,能够学习生成自己的脚手架。
一位首席技术官分享了关于自主编码工作流中执行层不足的见解,将这一概念追溯至1975年,并讨论了现代模型的选择。
一份全面指南,介绍如何部署 GLM 5.2(一款自称在编程基准测试中超越 GPT-5.5 且成本更低的开源 AI 模型),涵盖云端和本地部署方案。
deepreinforce-ai 发布了 Ornith-1.0,一个开源编码代理模型系列,在编码基准测试上实现了最先进的性能,提供从 9B 到 397B 的参数规模,采用自我改进训练框架和 MIT 许可证。
Cohere 发布 North Mini Code,一个30B-A3B开源权重模型,采用4位量化,用于代码生成和智能体编码任务,支持256K上下文。
本文介绍Qwopus3.6-27B-Coder模型的校准2位GGUF量化版本,用于智能体编码任务。实验表明,IQ2_M量化(9.74 GiB)在SWE-rebench基准测试中达到63%的通过率,与Q5_K_M量化相当,但模型大小仅为其一半。
推荐了 @mattpocockuk 发布的 agentic coding skills 套件 v1.0.0,其中包含“grill me”技能,能进行多轮细致提问,被认为在编程技能描述上极为精炼。
本文总结了Hacker News讨论中关于使用本地模型(主要是Qwen 3.6 35B-A3B)作为主力编码工具的实战经验,包括配置、效果(约为前沿模型的50-75%)、关键技巧(如preserve_thinking)和不同用户的立场。
HumanLayer推出了一个Agentic IDE和协作平台,使工程师能够在整个SDLC中提速2-3倍,同时保持严格的代码质量,已被Block、Uber等财富500强公司使用。
Phil Schmid 指出,Google 的 Gemma 4 模型支持本地自主编码,准确率/速度约为前沿模型的 75%,并引用了 Vicki Boykis 的文章。
Anthropic的最新经济研究分析了约40万次Claude Code会话,发现对于成功的代理编码,领域专业知识比编码技能更重要,并且任务价值在七个月内增加了约25%。
一条推文讨论了基准测试结果,其中 Qwopus Coder 位居榜首,而 Cohere 的 North-Mini-Code-1.0 在代理工具调用排行榜上垫底,显示出小模型的惊人结果。
小米开源了MiMo Code,一款采用新颖记忆架构的AI编码助手,在长期任务上表现优于Claude Code,并免费提供MiMo-V2.5模型。
Jane Street,此前对形式化方法持怀疑态度,现宣布转变观点,计划组建专注于形式化方法的团队。这一转变源于代理编程(agentic coding)的出现,它通过降低验证成本并增加对可靠代码的需求,改变了成本/效益计算。
Jane Street,此前对形式化方法持怀疑态度,现在正在组建团队使用它们,这得益于人工智能和智能体式编码,它们降低了成本并增加了软件验证的收益。
Claude Code 是 Anthropic 推出的一款终端中的智能编码工具,它能理解你的代码库,通过自然语言命令执行日常任务、解释复杂代码以及处理 git 工作流程,从而帮助你更快地编写代码。
作者通过从Firebase切换到InsForge(一个用于智能体编程的开源后端平台),将AI智能体的token用量降低了2.5倍,token数从550万降至230万,并消除了人工干预。
用户询问社区关于 qwopus 与 qwen3.6 27b 实用性的看法,特别是在代理编码任务中的表现,报告了意见不一且个人测试中差异极小。