Φ-Bench: 大型语言模型能否设计驱动自身的基础设施?
摘要
Φ-Bench是一个基准测试,旨在评估大型语言模型在工程设计和优化LLM基础设施栈方面的能力,覆盖从内核优化到端到端系统设计的任务。
查看缓存全文
缓存时间: 2026/09/10 06:11
论文页面 - Φ-Bench:大型语言模型能否设计驱动自身的基础设施?
来源:https://huggingface.co/papers/2609.10226 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
Φ-Bench 在从内核优化到端到端系统设计的多样化任务中,评估大型语言模型对LLM基础设施栈的开放式工程能力。
大型语言模型(LLMs)在推理和代码生成方面展现了卓越能力,使其有望协助开发和优化支撑自身的基础设施。然而,现有基准测试主要关注孤立的内核、预定义算子或预设优化目标,未能评估LLMs执行开放式、长周期的LLM基础设施工程的能力。为填补这一空白,我们推出Φ-Bench(https://huggingface.co/papers?q=%CE%A6-Bench),这是一个系统评估LLMs在LLM基础设施栈(https://huggingface.co/papers?q=LLM%20infrastructure%20stack)工程能力的基准测试。该基准源自前沿研究中探讨的优化问题,并基于真实代码库构建,Φ-Bench(https://huggingface.co/papers?q=%CE%A6-Bench)全面覆盖LLM基础设施栈(https://huggingface.co/papers?q=LLM%20infrastructure%20stack)的不同层次,任务复杂度各异——从局部内核级函数补全到长周期实现(https://huggingface.co/papers?q=long-horizon%20implementation)及端到端系统优化(https://huggingface.co/papers?q=end-to-end%20system%20optimization)。对前沿LLMs的大量实验揭示了它们在构建复杂LLM基础设施方面当前的能力与局限,为未来AI基础设施自主优化(https://huggingface.co/papers?q=autonomous%20optimization)面临的挑战提供了洞见。
查看arXiv页面(https://arxiv.org/abs/2609.10226)查看PDF(https://arxiv.org/pdf/2609.10226)项目页面(https://faibench.org/)GitHub 54(https://github.com/one2piece2hello/faibench_Frontier_InfraBench)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.10226)
通过代理获取此论文:
hf papers read 2609\.10226
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文 在模型README.md中引用arxiv.org/abs/2609.10226以从本页链接。
引用此论文的数据集0
无数据集链接此论文 在数据集README.md中引用arxiv.org/abs/2609.10226以从本页链接。
引用此论文的Spaces0
无Space链接此论文 在Space README.md中引用arxiv.org/abs/2609.10226以从本页链接。
包含此论文的收藏1
相似文章
Φ-Bench:大型语言模型能设计为其提供动力的基础设施吗?
Φ-Bench 是一个新的基准测试,用于评估大型语言模型在工程化和优化人工智能基础设施方面的能力,涵盖从内核级代码补全到端到端系统优化的任务。
FINESSE-Bench:面向大语言模型金融领域知识与技术分析的分层基准测试套件
本文介绍了FINESSE-Bench,一个包含八个专业基准、共3,993个问题的套件,用于对大语言模型进行金融能力的分层评估,涵盖专业认证主题与应用交易任务。
BrainBench:面向全面脑电图理解的大型语言模型基准测试
BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。