@VukRosic99: MusaCoder 训练了一个 27B 模型,用于编写原生 CUDA/MUSA 内核——在 KernelBench 上达到了 93.2 Pass@8,超过了 Claude Opus…
摘要
MusaCoder 训练了一个 27B 模型,在 KernelBench 上达到了 93.2 Pass@8,优于 Claude Opus(87.2),并提供了其数据管道、验证器和 RL 稳定器的 5 页技术摘要。
查看缓存全文
缓存时间: 2026/06/28 08:03
MusaCoder 训练了一个 27B 模型来编写原生 CUDA/MUSA 内核——在 KernelBench 上达到了 93.2 Pass@8,而 Claude Opus 4.7 是 87.2。
我制作了一份 5 页的技术摘要,涵盖其数据流水线、验证器和强化学习稳定器。
第 1-4 页在此。末页及链接如下 ↓ https://t.co/Luxe3TacYJ
相似文章
@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。
@LeonEnglaender: 我们核心代码团队只有8个人,我们的30B-A3B模型与Claude Haiku 4.5性能相当,并超越了NVIDIA…
一个8人团队发布了采用Apache 2.0许可的30B-A3B编码模型,其性能与Claude Haiku 4.5相当,并在Artificial Analysis Coding Index上击败了NVIDIA的120B-A12B Nemotron 3 Super。
Claude Opus 5 基准测试!
一篇介绍即将推出的 Claude Opus 5 AI 模型基准测试结果的文章。
@omarsar0: NVIDIA 的压缩论文,相当惊艳。(记得收藏)更大的 MoE 模型在质量上持续胜出,但以交互延迟提供服务仍然困难…
NVIDIA 的论文介绍了 Puzzle-75B-A9B,这是一种压缩的混合 MoE 模型,能够在保持质量的同时将服务器吞吐量提高一倍,从而实现大型语言模型的成本高效部署。
@elliotarledge:Claude Fable 5 [max] 在 KernelBench-Hard 上的表现。给我印象最深的核心是 B200 fp8 GEMM:它手动编写了原始的 SM10…
Claude Fable 5 通过为 B200 fp8 GEMM 手动编写 PTX 代码,在 KernelBench-Hard 上取得了顶级结果,超越了其他模型,并在计算密集型形状上达到峰值性能的 44-59%。