Metal-Sci:用于 Apple Silicon 上 LLM 驱动演化内核搜索的科学计算基准
摘要
Metal-Sci 推出了一项包含 10 个任务的基准测试,用于优化 Apple Silicon 上的科学计算内核,并配套了由大语言模型驱动的演化搜索框架。该研究评估了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 等模型,在实现显著加速的同时,利用分布外测试来捕获静默的性能退化问题。
查看缓存全文
缓存时间: 2026/05/12 10:53
论文页面 - Metal-Sci:面向 Apple Silicon 上进化式大语言模型内核搜索的科学计算基准 来源:https://huggingface.co/papers/2605.09708
摘要
针对 Apple Silicon 的科学计算内核优化构建了一个自动化搜索框架,该框架将大语言模型融入进化循环以提升性能,并通过分布外评估来识别隐性性能回退。我们推出了 Metal-Sci,这是一个包含 10 项任务的基准测试,聚焦于 Apple Silicon Metal 科学计算内核(https://huggingface.co/papers?q=Metal%20compute%20kernels),覆盖六大优化场景(https://huggingface.co/papers?q=optimization%20regimes)(模板计算、N体问题全对运算、多场玻尔兹曼求解、基于邻域的分子动力学、多核偏微分方程、快速傅里叶变换)。每项任务均标配 CPU 参考实现、以 Roofline 模型为基准的适应度函数(https://huggingface.co/papers?q=roofline-anchored%20fitness%20function)以及留出型泛化规模(https://huggingface.co/papers?q=held-out%20generalization%20size)。我们将基准测试与一套轻量级工具链结合,用于自动内核搜索(https://huggingface.co/papers?q=automatic%20kernel%20search)。该工具链支持对每个候选内核进行运行时编译,在多组规模下基于 Roofline 模型进行打分,并将结构化的编译日志与逐规模正确性诊断反馈给冻结参数的 LLM(https://huggingface.co/papers?q=frozen%20LLM),从而驱动一个 1+1 进化循环(https://huggingface.co/papers?q=evolutionary%20loop)。
我们在 M1 Pro 上报告了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 的同等单模型基准测试结果:分布内自加速比介于 1.00 倍至 10.7 倍之间。除单纯的加速比外,我们的核心方法论主张在于结构层面:预留门控评分函数 Φ_T(仅在任务结束时,针对智能体在搜索阶段从未接触过的配置进行一次评估)在此自动搜索闭环中充当了一种低成本机械监督原语(https://huggingface.co/papers?q=mechanical%20oversight%20primitive),能够精准捕获诸如 Opus 在模板 HMC 任务中胜出却在未见维度返回错误样本,以及 GPT 在 FFT3D 任务中以 2.95 倍加速比在分布内领先,却在 256^3 的预留立方体上骤降至 0.23 倍的案例。此类仅凭分布内评分难以察觉的静默性能回退(https://huggingface.co/papers?q=silent%20regression)正是本方法的关注重点。
代码仓库:https://github.com/vicgalle/metal-sci-kernels 查看 arXiv 页面 (https://arxiv.org/abs/2605.09708) 查看 PDF (https://arxiv.org/pdf/2605.09708) GitHub (https://github.com/vicgalle/metal-sci-kernels) 添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2605.09708) 在你的智能体中读取此论文:hf papers read 2605.09708 尚未安装最新版命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型
0 暂无链接此论文的模型 在模型 README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。
引用此论文的数据集
0 暂无链接此论文的数据集 在数据集 README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。
引用此论文的 Spaces
0 暂无链接此论文的 Space 在 Space README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。
收录此论文的集合
0 暂无收录此论文的集合 将此论文添加至集合 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
BaseRT:通过原生Metal在Apple Silicon上实现最佳LLM推理
BaseRT是一个专为Apple Silicon上的LLM构建的原生Metal推理运行时,在测试模型上,其解码吞吐量比llama.cpp高出1.56倍,比MLX高出1.35倍。
我移植了EXL3使其在Apple Silicon上良好运行 - PonyExl3
将EXL3 LLM编解码器移植到Apple Silicon上通过Metal运行,在M5 Max上实现了高预填充和生成速度(例如,~600 tok/s预填充,不同模型下17-80 tok/s生成)。
我构建了mlx-Chronos——一个面向Apple Silicon上本地LLM引擎的社区基准测试排行榜(oMLX、Rapid-MLX、mlx-lm、Ollama)
一位计算机科学学生构建了mlx-Chronos,这是一个开源命令行工具,通过测量TTFT、吞吐量、内存使用和热状态,标准化Apple Silicon上MLX推理引擎的基准测试,并提供一个社区排行榜来分享结果。
我在Apple Silicon上使用MLX和OpenClaw集成了新的δ-mem研究!我的发现
作者使用MLX和OpenClaw在Apple Silicon上实现了δ-mem研究论文,展示了在本地AI代理测试中的内存和注意力改进,尽管与CUDA基准相比结果好坏参半。
适用于 Apple Metal 的 Automatic1111,sd1.5 速度提升 40%
本文介绍了一个专为 Apple Silicon 优化的 Automatic1111 分支,加入了 Metal 优化(例如 Metal Flash Attention),以加速 Stable Diffusion 1.5 的生成速度,在 M3 Pro 上将时间从 8-10 秒缩短至 3-7 秒,在 M1 Mac Mini 上从 13-20 秒缩短至 8-10 秒。