@rasbt:Cohere 推出的全新开源权重模型:一款用于代理型编码任务的轻量级 30B 模型。该模型基于…
摘要
Cohere 发布了一款新的轻量级 30B 开源权重模型,专为代理型编码任务设计,基于 Command A+ 和并行 Transformer 架构构建,在 Terminal-Bench 和 SWE-Bench 等代理型基准测试中表现出色。
Cohere 推出的一款酷炫的新开源权重模型:一款用于代理型编码任务的轻量级 30B 开源权重模型。该模型基于 Command A+,采用并行 Transformer 设计。有趣的是,尽管其规模几乎减半,但层数却几乎翻了一番。此外,他们表示该模型是专门为代理型编码任务开发的,而不仅仅是普通的编码。也就是说,评估是在工作流中进行的,而不仅仅是简单的从提示到代码答案的单一任务。在 Terminal-Bench 中,模型需要使用终端、检查环境、运行命令、读取输出等。在 SWE-Bench 中,模型需要处理真实的 GitHub 风格的软件问题,它必须理解代码仓库、找到相关文件、制作补丁、通过测试等。SciCode 和 LiveCodeBench 则更为传统,因为它们主要测试模型能否为指定问题生成正确的代码。当然,这仍然需要推理能力,但更像是“实现一个数值例程,根据给定的方程和输入计算科学量”,这类任务无需与环境、现有文件或测试进行任何交互。专注于代理型编码基准测试可能是它在这些测试中远超 Gemma 4 的原因。总体而言,它非常有竞争力,尽管性能尚未达到 Qwen3.6 的水平。
相似文章
两周前我提问了代理与真实世界之间会出什么问题。你们的两个回复现在已成为任务
作者跟进之前的讨论,从社区报告的事件中创建公共基准任务,以测试AI代理在认证和预订等真实场景中的失败情况,并征求关于不变量检查的意见。
Apple Foundation Models:MacOS 27 原生本地 AI
Apple 已在 MacOS 27 上发布其 Apple Foundation Models (AFM),供本地使用,可通过终端命令访问,引发了关于本地 AI 和开放模型影响的讨论。
Salesforce 和 Nvidia 的新推理模型是所有 AI 实验室都应该畏惧的
Salesforce 和 Nvidia 推出了 Koa,一个基于 Nvidia 的 Nemotron 构建的新推理模型,专为企业任务如销售和客户支持而设计,为专有 AI 模型提供了一个开源权重的替代方案。
@interjc: 现在都是自然语言编程了,公平地说,这提高了门槛。过去,很多人写出了好的…
这条推文讨论了自然语言编程如何提高了编程的门槛,批评了缺乏清晰思考时,无论使用多少令牌,输出仍然糟糕。
Type Systems You Might Not Know (But Will Love)
本文列出了2026年北美世界大会即将举办的多个会议,重点关注类型系统、AI驱动编程和软件工程实践等主题。