标签
Poolside发布Laguna S 2.1,一个总参数量118B的混合专家(MoE)模型,每个token激活8B参数,支持长达100万token的上下文,在长周期编程基准测试中取得了有竞争力的成绩,并被誉为同重量级中最具能力的自主编程模型。
Google DeepMind发布了Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,重点聚焦效率、编程和网络安全,但备受期待的Gemini 3.5 Pro因内部延迟而未包含在内。
Google 的 Gemini 3.6 Flash 模型现已全面在 GitHub Copilot 中推出,专为 Web 和应用程序开发、编码以及代理任务而设计,与上一代相比,任务完成率更高,Token 效率更好。
Google 推出 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 模型,提升了 token 效率、降低了延迟,并为智能体工作流带来更优性能。其中,3.6 Flash 减少了 17% 的输出 token 用量,并在编程和知识任务中表现出色。
一份15页的论文介绍了内聚感知任务划分,以改善多智能体编码的扩展性,概述了从提示到图的新元过程。
一位用户分享了通过OpenRouter每天在AI令牌上花费超过100美元的经历,主要用于编程任务,并寻求降低成本的建议。
LM Studio推出Bionic,这是一个面向开放模型的AI智能体,支持编码、文档处理和离线语音转录,具备灵活的模型执行和零数据保留特性。
Kimi K3 是一款全新AI模型,拥有2.8万亿参数和100万上下文长度,已在网页和App上发布,在编程、智能体任务、推理、视觉和智能体集群方面具备领先能力。
一位用户测试了多种小型AI模型进行编程任务,发现Qwen3.6-27B-NVFP4在速度和准确性之间取得了最佳平衡,并指出这些模型在Java上的表现较差。
Thinking Machines 发布 Inkling,一种 MoE 模型,总参数975B/活跃41B,支持原生文本、图像和音频推理,上下文窗口达100万 token,完整权重可用。
由前 OpenAI 高管创立的 Thinking Machines Lab 发布了其首个开源权重 AI 模型 Inkling,该模型拥有 9750 亿参数,具备推理、编程以及处理音频、视频和文本的能力。
一条推文表达了对AI进步可能对软件工程造成重大颠覆的担忧。
Kimi K3 是 Moonshot 最新的开放权重模型,发布时具备新架构、智能体集群能力,并专注于长期智能体工作流,使其成为其他顶级模型的主要竞争者。
Matt Pocock 澄清了 /wayfinder 的预期工作流程,强调编码项目的流程应从 /wayfinder 到 /to-spec 再到 /to-tickets 再到 /implement,并指出 v1.2 正在开发中。
本文介绍了一种先竞争后协作的框架,多个前沿AI教师(Claude、Codex-GPT、Grok、Gemini)通过执行测试排名,然后协作构建可验证课程。研究发现,对教师解决方案进行模仿(SFT)会降低有能力的编程学生的表现,而使用相同课程进行带可验证奖励的强化学习(RLVR)则能提升表现,尤其是在竞赛问题上。
OpenAI发布了GPT-5.6,这是一个包含三个模型(Sol、Terra、Luna)的系列,具有更高的效率、更强的网络安全能力以及有竞争力的定价,主要面向企业和编码任务。
Muse Spark 1.1 是 Meta 新推出的代理与编码模型,在 HealthBench-Pro 上提升了 5% 的性能,超越了除 Fable 和 Mythos 外的所有竞争对手。
Matt Pocock 发布了 skills 工具的 v1.1 版本,新增了用于规划、规格说明、实现和代码审查的命令。发帖人已经从 superpowers 切换至该工具。