Metal-Sci:用于 Apple Silicon 上 LLM 驱动演化内核搜索的科学计算基准

Hugging Face Daily Papers 论文

摘要

Metal-Sci 推出了一项包含 10 个任务的基准测试,用于优化 Apple Silicon 上的科学计算内核,并配套了由大语言模型驱动的演化搜索框架。该研究评估了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 等模型,在实现显著加速的同时,利用分布外测试来捕获静默的性能退化问题。

我们推出了 Metal-Sci,这是一个针对 Apple Silicon Metal 科学计算内核的 10 项任务基准测试,涵盖六种优化范式(Stencil 计算、n体问题的全对计算、多场玻尔兹曼、邻居列表分子动力学、多内核偏微分方程、FFT)。每个任务均附带 CPU 参考实现、基于 Roofline 模型的适应度函数,以及泛化验证保留规模。我们将该基准与一个用于自动内核搜索的轻量级框架结合,该框架会即时编译每个候选内核,根据 Roofline 模型在多种规模下对其进行评分,并将结构化的编译诊断与逐规模正确性诊断反馈给一个冻结的大语言模型,由该模型驱动一个 (1+1) 演化循环。我们报告了在 M1 Pro 芯片上对 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 进行的单模型对照扫描测试:分布内自加速比介于 1.00 倍至 10.7 倍之间。除了原始加速比,我们的核心方法论主张是结构性的:保留门控评分函数 Φ_T(在运行结束时,针对智能体在搜索过程中从未见过的配置仅评估一次)在该自动搜索循环中充当了一种低成本的机械化监督原语。它能捕获例如 Opus 生成的 <uint D> HMC 模板在未见维度上返回错误样本的问题,以及 GPT 生成的 FFT3D 最优解在分布内以 2.95 倍加速获胜,但在 256^3 的保留立方体上却骤降至 0.23 倍的情况——这是一种仅靠分布内评分无法察觉的静默性能退化。代码位于:https://github.com/vicgalle/metal-sci-kernels
查看原文
查看缓存全文

缓存时间: 2026/05/12 10:53

论文页面 - Metal-Sci:面向 Apple Silicon 上进化式大语言模型内核搜索的科学计算基准 来源:https://huggingface.co/papers/2605.09708

摘要

针对 Apple Silicon 的科学计算内核优化构建了一个自动化搜索框架,该框架将大语言模型融入进化循环以提升性能,并通过分布外评估来识别隐性性能回退。我们推出了 Metal-Sci,这是一个包含 10 项任务的基准测试,聚焦于 Apple Silicon Metal 科学计算内核(https://huggingface.co/papers?q=Metal%20compute%20kernels),覆盖六大优化场景(https://huggingface.co/papers?q=optimization%20regimes)(模板计算、N体问题全对运算、多场玻尔兹曼求解、基于邻域的分子动力学、多核偏微分方程、快速傅里叶变换)。每项任务均标配 CPU 参考实现、以 Roofline 模型为基准的适应度函数(https://huggingface.co/papers?q=roofline-anchored%20fitness%20function)以及留出型泛化规模(https://huggingface.co/papers?q=held-out%20generalization%20size)。我们将基准测试与一套轻量级工具链结合,用于自动内核搜索(https://huggingface.co/papers?q=automatic%20kernel%20search)。该工具链支持对每个候选内核进行运行时编译,在多组规模下基于 Roofline 模型进行打分,并将结构化的编译日志与逐规模正确性诊断反馈给冻结参数的 LLM(https://huggingface.co/papers?q=frozen%20LLM),从而驱动一个 1+1 进化循环(https://huggingface.co/papers?q=evolutionary%20loop)。

我们在 M1 Pro 上报告了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 的同等单模型基准测试结果:分布内自加速比介于 1.00 倍至 10.7 倍之间。除单纯的加速比外,我们的核心方法论主张在于结构层面:预留门控评分函数 Φ_T(仅在任务结束时,针对智能体在搜索阶段从未接触过的配置进行一次评估)在此自动搜索闭环中充当了一种低成本机械监督原语(https://huggingface.co/papers?q=mechanical%20oversight%20primitive),能够精准捕获诸如 Opus 在模板 HMC 任务中胜出却在未见维度返回错误样本,以及 GPT 在 FFT3D 任务中以 2.95 倍加速比在分布内领先,却在 256^3 的预留立方体上骤降至 0.23 倍的案例。此类仅凭分布内评分难以察觉的静默性能回退(https://huggingface.co/papers?q=silent%20regression)正是本方法的关注重点。

代码仓库:https://github.com/vicgalle/metal-sci-kernels 查看 arXiv 页面 (https://arxiv.org/abs/2605.09708) 查看 PDF (https://arxiv.org/pdf/2605.09708) GitHub (https://github.com/vicgalle/metal-sci-kernels) 添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2605.09708) 在你的智能体中读取此论文:hf papers read 2605.09708 尚未安装最新版命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0 暂无链接此论文的模型 在模型 README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。

引用此论文的数据集

0 暂无链接此论文的数据集 在数据集 README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。

引用此论文的 Spaces

0 暂无链接此论文的 Space 在 Space README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。

收录此论文的集合

0 暂无收录此论文的集合 将此论文添加至集合 (https://huggingface.co/new-collection) 即可从此页面链接到它。

相似文章

适用于 Apple Metal 的 Automatic1111,sd1.5 速度提升 40%

Hacker News Top

本文介绍了一个专为 Apple Silicon 优化的 Automatic1111 分支,加入了 Metal 优化(例如 Metal Flash Attention),以加速 Stable Diffusion 1.5 的生成速度,在 M3 Pro 上将时间从 8-10 秒缩短至 3-7 秒,在 M1 Mac Mini 上从 13-20 秒缩短至 8-10 秒。