Fable 5 位居 KernelBench 榜首。Jack Clark 称其为“RSI 循环的起点”
摘要
Fable 通过编写高效 CUDA 超内核(megakernel),实现 18.71 倍加速,登上 KernelBench-Mega 榜首,标志着 AI 研发向递归自我改进迈出一步。
来自 Import AI:Fable 编写了一个出色的 GPU 内核,暗示更广泛的 AI 研发自动化:……RSI 循环的起点……根据基准测试维护者之一及其官方排行榜,Fable 编写了“有史以来提交给 KernelBench-Mega 的第一个真正(且最快)的超内核”。这表明 AI 系统在执行 AI 研发的一些基础任务(如内核设计)方面能力越来越强。结果:与优化的 PyTorch 基线相比,Fable 通过在 RTX PRO 6000 Blackwell 上编写 CUDA 代码实现了 18.71 倍的加速。作为参照,其他尝试的结果为:14.4 倍(Claude Opus 4.8,使用 Triton)、11.14 倍(GLM-5.2,Triton)和 4.34 倍(GPT 5.5,Triton)。这里就变得复杂了:这个方案尤其令人印象深刻,因为“torch.profiler 显示每个解码 token 恰好启动一次协作内核”。相比之下,其他所有高分方案都将问题分解为每个 token 4 到 14 次独立的内核启动。为何重要:能够自主开发和改进内核是进行 AI 研发的基本输入任务之一。AI 系统越擅长执行内核设计等任务,就越擅长 AI 开发所需的各类任务,这意味着它们越有可能实现递归自我改进。因此,像 KernelBench-Mega 这样的基准测试是衡量 AI 系统自我构建能力的重要信号。查看排行榜:KernelBench Mega(官方网站)。阅读来自基准测试维护者之一的分析(Elliot Arledge,X 平台)。
相似文章
Fable 5不再是第一了!?根据公司公告,Sakana的Fugu在某些情况下击败了它
根据Sakana AI的公司博客,其新模型Fugu在LiveCodeBench和Terminal Bench 2.1上以微小的优势超越了Fable 5,尽管结果尚未得到独立确认。
@elliotarledge:Claude Fable 5 [max] 在 KernelBench-Hard 上的表现。给我印象最深的核心是 B200 fp8 GEMM:它手动编写了原始的 SM10…
Claude Fable 5 通过为 B200 fp8 GEMM 手动编写 PTX 代码,在 KernelBench-Hard 上取得了顶级结果,超越了其他模型,并在计算密集型形状上达到峰值性能的 44-59%。
Claude Fable 5 基准测试
Anthropic 发布了 Claude Fable 5(一款新的人工智能模型)的基准测试,显示出显著的性能提升。
@heyshrutimishra: 1. Fable 5 在几乎所有重要基准测试中都是最先进的。软件工程。科学。知识工作。视觉……
Anthropic 发布了 Fable 5,声称它在软件工程、科学、知识工作和视觉等关键基准测试中达到了最先进水平,超过了所有先前可用的模型。
@PrajwalTomar_: 等等。Anthropic刚刚证明了你不需要Fable 5做所有事情。根据他们自己的基准测试。他们测试了"Fable 5编排…
Anthropic的基准测试显示,使用更大的模型(Fable)作为编排器,搭配更便宜的模型(Sonnet)作为执行者,可以达到Fable完整性能的96%,成本仅为46%,现已可在Claude Code中使用。