Φ-Bench:大型语言模型能设计为其提供动力的基础设施吗?

arXiv cs.CL 论文

摘要

Φ-Bench 是一个新的基准测试,用于评估大型语言模型在工程化和优化人工智能基础设施方面的能力,涵盖从内核级代码补全到端到端系统优化的任务。

arXiv:2609.10226v1 公告类型:新 摘要:大型语言模型(LLMs)在推理和代码生成方面展现了卓越的能力,使得它们有望协助开发和优化为其提供动力的基础设施。然而,现有的基准测试主要关注孤立的内核、预定义的算子或预指定的优化目标,因此无法评估LLMs执行开放式、长期LLM基础设施工程的能力。为了解决这一差距,我们提出了$\Phi$-Bench,一个用于系统评估LLMs在LLM基础设施堆栈工程方面的基准测试。$\Phi$-Bench源自前沿研究中的优化问题,并基于真实世界的代码库,提供了对LLM基础设施堆栈的广泛覆盖,并涵盖了从局部内核级函数补全到长期实施和端到端系统优化的各种复杂任务。对前沿LLMs的广泛实验揭示了它们在工程复杂LLM基础设施方面的当前能力和局限性,为未来AI基础设施自主优化道路上仍存在的挑战提供了见解。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:21

# 大语言模型能否设计其赖以生存的基础设施?  
来源:https://arxiv.org/html/2609.10226 \\xpatchcmd \\aaai@affiliations \\xpatchcmd \\aaai@affiliations 舒敏 王宇婷 黄凡琦 万殷敏 张涵 金汉 许一鸣 张飞宇 储小萌 游国亮 张武扬 蒋大昕 张艳阳  
###### 摘要  
大语言模型(LLMs)在推理和代码生成方面展现出卓越能力,引发了它们能否协助开发和优化支撑自身基础设施的前景讨论。然而,现有基准测试主要关注孤立的内核、预定义算子或预设优化目标,因此无法评估LLMs进行开放式、长周期大语言模型基础设施工程的能力。为填补这一空白,我们提出Φ-Bench,一个系统性评估LLMs在大语言模型基础设施栈工程化能力的基准。Φ-Bench源自前沿研究中的优化问题并基于真实代码仓库构建,广泛覆盖大语言模型基础设施栈,涵盖不同复杂度的任务——从局部的内核级函数完成到长周期的实现和端到端系统优化。在前沿LLMs上的广泛实验揭示了其在复杂大语言模型基础设施工程中的现有能力和局限性,为未来AI基础设施自主优化道路上仍存挑战提供了洞见。  
1中国科学技术大学 2阶跃星辰 3北京大学 4香港科技大学 5耶鲁大学 6宾夕法尼亚大学 attr/Border \[0 0 0\] user/Subtype /Link /A << /S /URI /URI \(https://faibench\.org\) \>\>排行榜 attr/Border \[0 0 0\] user/Subtype /Link /A << /S /URI /URI \(https://github\.com/one2piece2hello/faibench\_LLM\_Infra\_Bench\) \>\>GitHub attr/Border \[0 0 0\] user/Subtype /Link /A << /S /URI /URI \(https://huggingface\.co/datasets/faibench\-Frontier\-Infra\-Bench/faibench\_Frontier\_Infra\_Bench\) \>\>Hugging Face ‡‡footnotetext:在阶跃星辰完成的实习工作。\*\*footnotetext:同等贡献。††footnotetext:通讯作者:蒋大昕和张艳阳。  
## 引言  
随着大语言模型(LLMs)在推理(Guo et al\. 2025 (https://arxiv.org/html/2609.10226#bib.bib20))和代码生成(Z\.AI 2026 (https://arxiv.org/html/2609.10226#bib.bib16))方面的近期进展,利用LLMs支持下一代AI模型开发已成为一个有前景的研究方向(Ma et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib22);Ishibashi et al\. 2025 (https://arxiv.org/html/2609.10226#bib.bib21))。在此背景下,一个特别重要的挑战是工程化和优化支撑LLM训练与推理的软件基础设施,以下简称*大语言模型基础设施*。先前工作(Kwon et al\. 2023 (https://arxiv.org/html/2609.10226#bib.bib10);Narayanan et al\. 2021 (https://arxiv.org/html/2609.10226#bib.bib12))已证明,基础设施层面的优化可显著提高GPU利用率并降低计算成本。这些进展自然引出了一个有趣的问题:大语言模型能否设计和优化其赖以生存的基础设施?尽管已有多个基准测试评估了LLMs在GPU内核实现(Ouyang et al\. 2025 (https://arxiv.org/html/2609.10226#bib.bib1);Li et al\. 2025 (https://arxiv.org/html/2609.10226#bib.bib2))和优化(Nangia et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib3);Li et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib4))方面的能力,但其评估场景通常局限于单个函数或小规模孤立组件的集合。因此,它们未能完全捕捉工程化和优化真实大语言模型基础设施的复杂性。实际上,这类任务本质上是长周期且开放式的:开发者必须理解和导航现有基础设施栈,识别瓶颈和优化机会,并迭代地实现、分析、调试和完善其解决方案。这种端到端的工作流远超出代码补全或孤立的、单次提交的修改。此外,现有基准测试仅覆盖大语言模型基础设施工程中的一小部分主题,限制了其全面评估LLM能否开发和优化现代AI基础设施的能力。这些局限性凸显了需要一个全面、长周期且开放式的基准,以更真实地评估LLMs能否设计其赖以生存的基础设施。  
请参阅标题图1:前沿模型在Φ-Bench上的性能。左图:不同模型获得的整体得分。右图:模型在不同基础设施主题上的表现。  
为弥合这一差距,我们推出Φ-Bench(前沿AI基础设施基准),作为对源自顶级系统论文和公共大语言模型基础设施代码库的真实工作负载进行前沿LLMs系统性评估的基准。其设计由三个原则指导:长周期、开放式问题解决;全面覆盖大语言模型基础设施;可扩展的任务合成。与仅关注完成孤立函数的基准不同,Φ-Bench允许智能体导航现有代码库,并迭代地实现、分析、调试和完善其解决方案。为实现广泛覆盖,我们从收集的2,260篇论文和1,852个公共代码库构件中,自下而上构建了现代大语言模型基础设施的分类体系,并用以指导任务合成。为超越手动策划工程构件的有限供应以扩展基准构建,我们开发了一种基于智能体循环的流程,可自动从代码库中挖掘高价值挑战,并通过迭代测试生成构建全面的测试用例。这些设计共同实现了对LLM智能体在基础设施工程方面广泛、真实且可扩展的评估。生成的基准包含85个具有挑战性的任务,分为三种任务格式,其范围和开放式程度逐级增加:内核函数完成、长周期实现和端到端优化。这些格式共同构成了一个分层评估体系,涵盖本地内核实现、代码库级基础设施开发和端到端系统优化。该设计使Φ-Bench能够区分智能体在实现高效计算原语、进行长周期代码库工程以及执行开放式、基于假设的基础设施优化方面的能力。  
使用Φ-Bench,我们对前沿LLMs进行了系统性评估。表现最佳的模型Claude Opus 5获得36.53%的得分,仍有巨大提升空间。进一步实验揭示了迭代优化次数和推理预算如何影响模型性能。对模型解决方案轨迹的详细分析进一步揭示了其各自的优势和劣势,为未来模型改进提供了洞见,并凸显了LLMs在可靠参与设计和优化其赖以生存的基础设施之前必须应对的关键挑战。  
总之,我们的贡献如下:  
- •我们介绍了Φ-Bench(前沿AI基础设施基准),包含85个基于真实工作设计和优化LLM训练与推理基础设施的挑战性任务。  
- •我们开发了一种系统的、分类体系指导的基准构建方法,该方法基于论文和代码库构件,并构建了一个基于智能体循环的合成流程,可自动从代码库挖掘候选工程问题,并通过迭代测试生成构建全面的测试用例。  
- •我们在Φ-Bench上系统评估了前沿LLMs,并分析了其解决方案轨迹,揭示了巨大的改进空间,并为未来模型改进提供了洞见。  
## 相关工作  
### 大语言模型基础设施优化  
大语言模型基础设施优化旨在跨多个层级提升LLM训练与推理的性能、效率和可扩展性。在计算层,CUTLASS(NVIDIA 2017 (https://arxiv.org/html/2609.10226#bib.bib8))为高性能GPU内核提供了可复用的构建模块,而Triton(Tillet et al\. 2019 (https://arxiv.org/html/2609.10226#bib.bib6))提供了用于开发优化GPU程序的编程语言和编译器。补充这些低层抽象的还有如FlashAttention(Dao et al\. 2022 (https://arxiv.org/html/2609.10226#bib.bib29))和FlashInfer(Ye et al\. 2025 (https://arxiv.org/html/2609.10226#bib.bib30))等系统,它们通过IO感知的注意力算法、优化的内核和硬件高效执行进一步加速了LLM的训练和推理。超越单个内核和运行时,训练框架如Megatron-LM(Shoeybi et al\. 2019 (https://arxiv.org/html/2609.10226#bib.bib5))和DeepSpeed(Rasley et al\. 2020 (https://arxiv.org/html/2609.10226#bib.bib7))支持并行执行、内存分区和通信优化,而推理系统如Orca(Yu et al\. 2022 (https://arxiv.org/html/2609.10226#bib.bib9))、vLLM(Kwon et al\. 2023 (https://arxiv.org/html/2609.10226#bib.bib10))和SGLang(Zheng et al\. 2024 (https://arxiv.org/html/2609.10226#bib.bib11))提供了KV缓存管理、连续批处理、请求调度和分布式服务。  
### 大语言模型基础设施工程基准  
近期基准测试已评估了LLMs实现和优化大语言模型基础设施组件的能力(Lin et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib27);Wang et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib28))。KernelBench(Ouyang et al\. 2025 (https://arxiv.org/html/2609.10226#bib.bib1))、TritonBench(Li et al\. 2025 (https://arxiv.org/html/2609.10226#bib.bib2))和FlashInfer-Bench(Xing et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib26))主要关注单个GPU算子或融合算子组合,具有预定义的接口、输入输出规格和优化目标。因此,它们不要求LLMs导航完整的基础设施代码库、识别性能瓶颈或协调软件栈多个层级的修改。ISO-Bench(Nangia et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib3))和CUDAHercules(Li et al\. 2026 (https://arxiv.org/html/2609.10226#bib.bib4))将此评估扩展到代码库级GPU优化,但其任务通常指定了目标组件和性能瓶颈,因此提供的证据有限,无法说明LLM能否解决开放式大语言模型基础设施工程挑战。  
请参阅标题图2:Φ-Bench的任务合成流程。  
## 基准设计与构建  
在本节中,我们将描述任务格式、构建过程和评估指标,如图2(https://arxiv.org/html/2609.10226#Sx2.F2)所示。  
### 任务格式  
每个Φ-Bench任务包含自然语言规格说明、完整的大语言模型基础设施代码库、可执行工作负载或测试用例,以及评估工具。所有材料(包括测试用例)对智能体可见,但评估工具除外。规格说明定义了所需的功能或性能目标。Φ-Bench包含三种任务格式,其范围和开放式程度逐步增加。内核函数完成指定了目标函数及其接口;长周期实现指定了一个功能但其实施路径开放;端到端优化仅指定系统级目标和约束。它们的编辑和提交范围相应扩展,总结见表1(https://arxiv.org/html/2609.10226#Sx3.T1)。  
表1:三种任务类型的比较。  
| 任务类型       | 实现目标 | 可编辑区域   | 提交限制 |  
|----------------|----------|--------------|----------|  
| KFC            | 指定     | 单文件       | 单次     |  
| LHI            | 指定     | 多文件       | 多次     |  
| E2EO           | 自由     | 整个代码库   | 多次     |  
#### 内核函数完成(KFC)。  
内核函数完成任务隔离一个性能关键的内核或算子,其接口和输入输出语义被明确指定。智能体在单个文件内完成或优化其实现,而不改变外部接口。提交首先测试功能正确性和数值精度,然后对正确的解决方案进行效率基准测试。因此,内核函数完成评估正确高效计算原语的实现。  
#### 长周期实现(LHI)。  
长周期实现任务提供一个类似问题描述的功能请求和粗粒度的可编辑范围(如代码库子模块),但未指定相关文件、依赖关系和实施策略。解决它需要导航代码库、理解模块间的交互、修改多个文件,并迭代地构建、测试和调试实现。因此,长周期实现评估非平凡的代码库级开发,而非孤立的函数完成。  
#### 端到端优化(E2EO)。  
端到端优化任务提供一个代表性工作负载、一个系统级优化目标和一组约束,但未规定使用哪些组件或策略。智能体必须分析系统、识别瓶颈、制定优化计划,并实施可能涉及整个代码库的修改。因此,端到端优化评估瓶颈发现、跨层推理和基于假设的基础设施优化。  
图3:我们覆盖分类体系的高级和中级主题。外圈中的线条代表不同基准测试覆盖的主题。  
### 任务合成  
Φ-Bench任务源自与大语言模型基础设施相关的真实研究和工程构件,而非手工编写的合成编程提示。我们收集在顶级系统会议上发表的论文,以及来自公共GitHub仓库的、实现代表性大语言模型基础设施的构件。然后,我们构建一个大语言模型基础设施工程的覆盖分类体系,并在该体系指导下合成任务。  
#### 来源收集与筛选。  
对于学术来源库,我们收集了2023年至2026年期间在顶级系统会议上发表的论文。然后,我们使用基于LLM的筛选流程,保留与LLM基础设施直接相关、主要研究LLM训练或推理的实现、加速或资源优化,并提供公开可用实现的论文。对于工程来源库,我们检查广泛使用的大语言模型基础设施公共仓库中的问题和拉取请求。我们同样使用LLMs筛选非平凡且具有技术挑战性的构件,优先考虑那些引入重大优化、添加重要基础设施功能、解决特定硬件或工作负载限制,或记录困难工程问题的构件。此过程产生了2,260篇论文和1,852个工程构件。  
#### 覆盖分类体系构建。  
我们将选定的来源组织成一个分层的、三级的覆盖分类体系。对于每个来源,我们提示一个大型语言模型在三个预定义层级上分配标签。顶级捕捉大语言模型基础设施工程和优化的广泛领域。中级识别更具体的研究问题、技术、基础设施组件和工作负载特征,而底层由描述具体

相似文章

BrainBench:面向全面脑电图理解的大型语言模型基准测试

arXiv cs.AI

BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。