@LeonEnglaender: 我们核心代码团队只有8个人,我们的30B-A3B模型与Claude Haiku 4.5性能相当,并超越了NVIDIA…
摘要
一个8人团队发布了采用Apache 2.0许可的30B-A3B编码模型,其性能与Claude Haiku 4.5相当,并在Artificial Analysis Coding Index上击败了NVIDIA的120B-A12B Nemotron 3 Super。
查看缓存全文
缓存时间: 2026/06/10 05:48
我们核心代码团队只有8人,但我们的30B-A3B模型在Artificial Analysis编码指数上与Claude Haiku 4.5持平,并领先于NVIDIA的120B-A12B Nemotron 3 Super。该模型基于Apache 2.0许可发布。为我们的工作深感自豪,未来还有更多精彩!https://t.co/F2wu66R16h
Cohere (@cohere): 推出Cohere首个开源编码模型:North Mini Code
小巧高效,专为智能体性能设计,并基于社区反馈构建。
相似文章
开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]
一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。
NVIDIA 刚刚宣布发布 Nemotron 3 Ultra(2分钟阅读)
Anthropic 发布了其最智能的模型 Claude Opus 4.5,在 Artificial Analysis Intelligence Index 上获得 70 分,仅次于 Gemini 3 Pro。该模型在编码和智能体任务方面取得了显著进步,同时降低了每个token的价格,并保持了强劲的安全性能。
@xdotli: 我的朋友 @xeophon 认为编码问题已经解决了,这里有一个验证:一个3B模型接受了以算法效率为重点的训练……
Nanbeige 4.1,一个3B模型,在编码任务中专注于算法效率,超越了Qwen3-30b-A3b和Qwen 3.5 4b,实现了600多次工具调用的长时任务。
@elliotarledge:Claude Fable 5 [max] 在 KernelBench-Hard 上的表现。给我印象最深的核心是 B200 fp8 GEMM:它手动编写了原始的 SM10…
Claude Fable 5 通过为 B200 fp8 GEMM 手动编写 PTX 代码,在 KernelBench-Hard 上取得了顶级结果,超越了其他模型,并在计算密集型形状上达到峰值性能的 44-59%。
@jinyuhou0: 在主流基准测试中,我们的30B模型与规模大20-30倍的系统(gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)匹敌,而……
一款新的30B模型在主流基准测试中与规模大20-30倍的系统匹敌,同时相比同类30/32B智能体大语言模型,使用的推理令牌减少高达95%。这是通过一个学习型配置器实现的,该配置器决定何时以及如何进行推理。模型和代码已开放。