@rasbt:Cohere 推出的全新开源权重模型:一款用于代理型编码任务的轻量级 30B 模型。该模型基于…
摘要
Cohere 发布了一款新的轻量级 30B 开源权重模型,专为代理型编码任务设计,基于 Command A+ 和并行 Transformer 架构构建,在 Terminal-Bench 和 SWE-Bench 等代理型基准测试中表现出色。
Cohere 推出的一款酷炫的新开源权重模型:一款用于代理型编码任务的轻量级 30B 开源权重模型。该模型基于 Command A+,采用并行 Transformer 设计。有趣的是,尽管其规模几乎减半,但层数却几乎翻了一番。此外,他们表示该模型是专门为代理型编码任务开发的,而不仅仅是普通的编码。也就是说,评估是在工作流中进行的,而不仅仅是简单的从提示到代码答案的单一任务。在 Terminal-Bench 中,模型需要使用终端、检查环境、运行命令、读取输出等。在 SWE-Bench 中,模型需要处理真实的 GitHub 风格的软件问题,它必须理解代码仓库、找到相关文件、制作补丁、通过测试等。SciCode 和 LiveCodeBench 则更为传统,因为它们主要测试模型能否为指定问题生成正确的代码。当然,这仍然需要推理能力,但更像是“实现一个数值例程,根据给定的方程和输入计算科学量”,这类任务无需与环境、现有文件或测试进行任何交互。专注于代理型编码基准测试可能是它在这些测试中远超 Gemma 4 的原因。总体而言,它非常有竞争力,尽管性能尚未达到 Qwen3.6 的水平。
相似文章
新版DeepSeek V4-Flash在ArtificalAnalysis Index上取得50分,比GLM-5.2和GPT-5.6 Luna低1分
DeepSeek的新V4-Flash模型在ArtificalAnalysis Index上得分为50,仅比GLM-5.2和GPT-5.6 Luna低1分。
DeepSeek-V4-Flash-0731 将再次引发市场崩盘。
据报道,DeepSeek-V4-Flash-0731 性能优于 GLM 5.2,同时成本与前代保持一致,引发了对其再次造成市场扰动的猜测。
IFCMemoryBench:评估基于LLM的智能体在BIM信息检索中的长期记忆
本文介绍了IFCMemoryBench,一个经过人工验证的基准测试,用于评估基于LLM的智能体在BIM信息检索中的长期记忆。研究表明,当前的记忆系统仅能达到32.4%的答案准确率,揭示了智能体记忆中的领域迁移差距。
SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search
SimpleWikiSearch 是一个可复现的离线 Wikipedia 环境,用于评估基于 LLM 的 agentic 搜索系统,明确规定了语料构建、检索栈和工具接口。
放射学视觉语言模型基准的取证可重复性审计:从预期协议到发布产物
本文对放射学视觉语言模型基准进行了取证式可重复性审计,发现预期协议与发布产物之间存在差异,这些差异使原始声明失效。作者提出了一种基准合约,以暴露此类失败类别。