Φ-Bench: 大型语言模型能否设计驱动自身的基础设施?

Hugging Face Daily Papers 论文

摘要

Φ-Bench是一个基准测试,旨在评估大型语言模型在工程设计和优化LLM基础设施栈方面的能力,覆盖从内核优化到端到端系统设计的任务。

大型语言模型(LLMs)在推理和代码生成方面展现出了卓越的能力,引发了人们期望它们能够协助开发和优化为其提供支持的基础设施。然而,现有的基准测试主要关注孤立的内核、预定义的算子或预设的优化目标,因此无法评估LLMs执行开放式、长期LLM基础设施工程的能力。为了填补这一空白,我们推出了Φ-Bench,一个用于系统评估LLMs在LLM基础设施栈工程方面能力的基准测试。Φ-Bench源自前沿研究中研究的优化问题,并基于真实代码库,广泛覆盖LLM基础设施栈,并涵盖不同复杂度的任务,从局部的内核级函数补全到长期的实现和端到端系统优化。对前沿LLMs的大量实验揭示了它们在工程化复杂LLM基础设施方面的当前能力和局限性,为未来AI基础设施自主优化道路上仍然存在的挑战提供了见解。
查看原文
查看缓存全文

缓存时间: 2026/09/10 06:11

论文页面 - Φ-Bench:大型语言模型能否设计驱动自身的基础设施?

来源:https://huggingface.co/papers/2609.10226 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

Φ-Bench 在从内核优化到端到端系统设计的多样化任务中,评估大型语言模型对LLM基础设施栈的开放式工程能力。

大型语言模型(LLMs)在推理和代码生成方面展现了卓越能力,使其有望协助开发和优化支撑自身的基础设施。然而,现有基准测试主要关注孤立的内核、预定义算子或预设优化目标,未能评估LLMs执行开放式、长周期的LLM基础设施工程的能力。为填补这一空白,我们推出Φ-Bench(https://huggingface.co/papers?q=%CE%A6-Bench),这是一个系统评估LLMs在LLM基础设施栈(https://huggingface.co/papers?q=LLM%20infrastructure%20stack)工程能力的基准测试。该基准源自前沿研究中探讨的优化问题,并基于真实代码库构建,Φ-Bench(https://huggingface.co/papers?q=%CE%A6-Bench)全面覆盖LLM基础设施栈(https://huggingface.co/papers?q=LLM%20infrastructure%20stack)的不同层次,任务复杂度各异——从局部内核级函数补全到长周期实现(https://huggingface.co/papers?q=long-horizon%20implementation)及端到端系统优化(https://huggingface.co/papers?q=end-to-end%20system%20optimization)。对前沿LLMs的大量实验揭示了它们在构建复杂LLM基础设施方面当前的能力与局限,为未来AI基础设施自主优化(https://huggingface.co/papers?q=autonomous%20optimization)面临的挑战提供了洞见。

查看arXiv页面(https://arxiv.org/abs/2609.10226)查看PDF(https://arxiv.org/pdf/2609.10226)项目页面(https://faibench.org/)GitHub 54(https://github.com/one2piece2hello/faibench_Frontier_InfraBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.10226)

通过代理获取此论文:

hf papers read 2609\.10226

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文 在模型README.md中引用arxiv.org/abs/2609.10226以从本页链接。

引用此论文的数据集0

无数据集链接此论文 在数据集README.md中引用arxiv.org/abs/2609.10226以从本页链接。

引用此论文的Spaces0

无Space链接此论文 在Space README.md中引用arxiv.org/abs/2609.10226以从本页链接。

包含此论文的收藏1

相似文章

BrainBench:面向全面脑电图理解的大型语言模型基准测试

arXiv cs.AI

BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。