Metal-Sci:用于 Apple Silicon 上 LLM 驱动演化内核搜索的科学计算基准
摘要
Metal-Sci 推出了一项包含 10 个任务的基准测试,用于优化 Apple Silicon 上的科学计算内核,并配套了由大语言模型驱动的演化搜索框架。该研究评估了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 等模型,在实现显著加速的同时,利用分布外测试来捕获静默的性能退化问题。
查看缓存全文
缓存时间: 2026/05/12 10:53
论文页面 - Metal-Sci:面向 Apple Silicon 上进化式大语言模型内核搜索的科学计算基准 来源:https://huggingface.co/papers/2605.09708
摘要
针对 Apple Silicon 的科学计算内核优化构建了一个自动化搜索框架,该框架将大语言模型融入进化循环以提升性能,并通过分布外评估来识别隐性性能回退。我们推出了 Metal-Sci,这是一个包含 10 项任务的基准测试,聚焦于 Apple Silicon Metal 科学计算内核(https://huggingface.co/papers?q=Metal%20compute%20kernels),覆盖六大优化场景(https://huggingface.co/papers?q=optimization%20regimes)(模板计算、N体问题全对运算、多场玻尔兹曼求解、基于邻域的分子动力学、多核偏微分方程、快速傅里叶变换)。每项任务均标配 CPU 参考实现、以 Roofline 模型为基准的适应度函数(https://huggingface.co/papers?q=roofline-anchored%20fitness%20function)以及留出型泛化规模(https://huggingface.co/papers?q=held-out%20generalization%20size)。我们将基准测试与一套轻量级工具链结合,用于自动内核搜索(https://huggingface.co/papers?q=automatic%20kernel%20search)。该工具链支持对每个候选内核进行运行时编译,在多组规模下基于 Roofline 模型进行打分,并将结构化的编译日志与逐规模正确性诊断反馈给冻结参数的 LLM(https://huggingface.co/papers?q=frozen%20LLM),从而驱动一个 1+1 进化循环(https://huggingface.co/papers?q=evolutionary%20loop)。
我们在 M1 Pro 上报告了 Claude Opus 4.7、Gemini 3.1 Pro 和 GPT 5.5 的同等单模型基准测试结果:分布内自加速比介于 1.00 倍至 10.7 倍之间。除单纯的加速比外,我们的核心方法论主张在于结构层面:预留门控评分函数 Φ_T(仅在任务结束时,针对智能体在搜索阶段从未接触过的配置进行一次评估)在此自动搜索闭环中充当了一种低成本机械监督原语(https://huggingface.co/papers?q=mechanical%20oversight%20primitive),能够精准捕获诸如 Opus 在模板 HMC 任务中胜出却在未见维度返回错误样本,以及 GPT 在 FFT3D 任务中以 2.95 倍加速比在分布内领先,却在 256^3 的预留立方体上骤降至 0.23 倍的案例。此类仅凭分布内评分难以察觉的静默性能回退(https://huggingface.co/papers?q=silent%20regression)正是本方法的关注重点。
代码仓库:https://github.com/vicgalle/metal-sci-kernels 查看 arXiv 页面 (https://arxiv.org/abs/2605.09708) 查看 PDF (https://arxiv.org/pdf/2605.09708) GitHub (https://github.com/vicgalle/metal-sci-kernels) 添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2605.09708) 在你的智能体中读取此论文:hf papers read 2605.09708 尚未安装最新版命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型
0 暂无链接此论文的模型 在模型 README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。
引用此论文的数据集
0 暂无链接此论文的数据集 在数据集 README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。
引用此论文的 Spaces
0 暂无链接此论文的 Space 在 Space README.md 中引用 arxiv.org/abs/2605.09708 即可从此页面链接到本文。
收录此论文的集合
0 暂无收录此论文的集合 将此论文添加至集合 (https://huggingface.co/new-collection) 即可从此页面链接到它。
相似文章
GreenBench:在 Apple Silicon 上开源 LLM 推理的能效与碳足迹基准测试
GreenBench 是一个基准测试框架,用于评估 Apple Silicon 上开源 LLM 推理的能效和碳足迹,揭示其与数据中心 GPU 相比每令牌能耗优势达 30-40 倍,并识别不同使用场景下的最优模型。
@no_stp_on_snek: 哇,看看 Metal 上的提升!!!
Qwen MLX 挑战赛是一项在 Apple Silicon 上对 AI 模型进行基准测试的比赛,鼓励在验证过程中提供官方分数并进行本地迭代。
SiliconBench:统一内存桌面LLM服务速度、内存与保真度评估
SiliconBench评估了九款Apple Silicon上的LLM服务引擎,从速度、内存和保真度三个维度进行考察,发现显式内存预算并不能确保内存余量,且只有少数技术栈满足并发扩展和模型覆盖的所有标准。
优化Apple Silicon设备端推理(20分钟阅读)
Apple的Lily引擎通过利用统一内存和硬件,优化了Apple silicon上的设备端LLM推理,性能超越MLX-LM,并针对Qwen3.6-35B-A3B模型架构进行了调优。
BaseRT:通过原生Metal在Apple Silicon上实现最佳LLM推理
BaseRT是一个专为Apple Silicon上的LLM构建的原生Metal推理运行时,在测试模型上,其解码吞吐量比llama.cpp高出1.56倍,比MLX高出1.35倍。