[2511.07885] 每瓦智能:测量本地AI的智能效率
摘要
本文首次系统研究了不同模型和硬件的本地AI推理效率,测量了每瓦智能,并显示从2023年到2025年效率提升了5.3倍,表明有可能重新分配对集中式基础设施的需求。
查看缓存全文
缓存时间: 2026/08/19 10:42
# 每瓦智能:本地AI的智能效率度量
来源:https://arxiv.org/html/2511.07885
Avanika Narayan, Hakki Orhun Akengin, J. Wes Griffin, Herumb Shandilya, Adrian Gamarra Lafuente, Medhya Goel, Rebecca Joseph, Shlok Natarajan, Etash Kumar Guha, Shang Zhu, Ben Athiwaratkun, John Hennessy, Azalia Mirhoseini, Christopher Ré
## 1 引言
大型语言模型(LLM)查询主要由部署在集中式云基础设施中的前沿模型处理\[55, 2\]。随着推理工作负载从每日数十亿扩展到数万亿次查询,这种集中式方法面临着日益严峻的资源限制\[2\]。历史经验指明了另一条前进道路:从1946年至2009年,计算效率(性能功耗比)每1.5年翻一番\[37\],使得计算工作负载得以从数据中心的大型机重新分配到个人电脑。这一转变发生在效率改进使计算能够在个人设备的功耗约束内满足用户需求之时,而非个人电脑在原始性能上超越大型机之时。
三个趋同的趋势表明,LLM推理可能正迎来类似的拐点。首先,近期进展催生了**本地语言模型**:参数规模较小(活跃参数≤200亿)的模型,如Qwen3\[62\]、Llama3.1\[26\]和gpt-oss\[1\],在多个基准测试上取得了具有竞争力的性能,同时比更大规模的前沿模型消耗更少的能量和计算资源\[1\]。其次,本地加速器(例如Apple M4 Max、AMD Ryzen AI)现在具有足够的内存容量和计算吞吐量,可以以交互式延迟运行这些模型\[8\]。第三,一波专为设备端执行设计的开源个人AI代理栈已经出现(例如OpenClaw\[74\]、Hermes Agent\[44\]、OpenJarvis\[63\]、PicoClaw\[71\]和ZeroClaw\[88\]),反映出对本地优先系统设计日益增长的兴趣。
这引出了一个问题:**本地推理能否有效地将需求从集中式基础设施重新分配?**
> **图1:每瓦智能:本地智能效率研究。**
> 我们首次系统性地研究了本地AI推理在模型、硬件和真实工作负载上的效率。
> (左)智能效率被定义为每单位功耗的任务准确率,同时捕捉交付的能力与消耗的能量。
> (中左)我们对20多种最先进的本地LM(≤200亿活跃参数)、多样化的硬件加速器(Apple、NVIDIA、AMD)、多种性能指标以及超过100万涵盖聊天和推理任务的真实查询进行了全面的性能分析。
> (中右)本地LM能力正在快速提升:与前沿模型的胜率/平局率从2023年的23.2%上升至2025年的71.3%,准确率提升3.1倍,表明本地模型能够准确处理相当大部分的单轮聊天和推理查询。
> (右)每瓦智能从2023年到2025年提升了5.3倍,由模型架构和硬件加速器的共同进步驱动,其中本地加速器相比企业级系统展现出1.5倍的效率提升空间。
回答这个问题需要度量两个因素:本地LM准确响应部分真实查询的**能力**,以及本地加速器将电力转换为有用计算的**效率**。为此,我们需要一个统一的指标来同时捕捉交付的智能(模型能力)和所需的能量(加速器效率)。我们引入了**每瓦智能(IPW)**:每单位功耗的任务准确率。IPW直接衡量了本地推理面临的基本权衡:在有限的功耗预算内实现足够的任务性能。该指标能够对不同模型-加速器配置进行系统性比较,并量化来自模型架构创新\[62, 1, 24, 35\]、训练后技术\[30, 57, 68, 22\]以及加速器改进\[39, 51, 4\]的效率增益。
为了评估本地推理的可行性并衡量IPW的进展,我们进行了一项大规模实证研究,解答以下三个问题:
- • **Q1:** 当前推理查询中有多少比例可以由本地加速器上的本地LM解决?这一比例随时间如何变化?
- • **Q2:** 在连续几代本地模型和加速器中,每瓦智能如何提升?模型进步与硬件进步各自的相对贡献如何?
- • **Q3:** 通过在本地和云基础设施之间分配工作负载,可以节省多少资源(例如计算、能源、美元成本)?
我们的研究评估了8种硬件加速器上的20多种本地LM,涵盖了超过100万条查询,包括自然用户对话\[20\]、通用推理任务\[87\]以及衡量知识广度(MMLU Pro\[80\])和专家级推理(SuperGPQA\[59\])的标准化基准。我们关注单轮交互,因为它们占据了LLM使用的很大一部分\[21, 79, 70\]。
^1^ 我们在附录E.12中报告了GAIA和TerminalBenchV2上的多轮扩展,确认了定性模式具有普遍性。
我们将2025年10月的最先进本地LM(Qwen3、gpt-oss、Gemma3、IBM Granite4)与2023-2024年的模型(Mixtral-8x7B、Llama-3.1-8B)在NVIDIA、AMD和Apple加速器上进行比较,测量每查询的准确率、延迟、能耗、计算量、成本和内存(第3节)。我们发布了与硬件无关的分析工具,以支持可复现的效率基准测试。
我们的工作有三个主要贡献:
(1)我们引入了每瓦智能(IPW)作为评估本地推理可行性的统一指标,并进行了首次大规模实证研究,衡量了其在超过100万查询、20多种模型和8种硬件加速器上(2023-2025年)的演变。
(2)(Q1, Q2)我们证明,88.7%的单轮聊天和推理查询可以成功由小型本地模型处理(覆盖率因领域而异),并且通过模型(3.1倍)和硬件(1.7倍)的复合进步,IPW在两年内提升了5.3倍。
^2^ 相应的每焦耳分解(图3)总体提升18.0倍,其中模型贡献3.1倍,硬件贡献5.9倍,因为硬件进步不成比例地降低了延迟。Mixtral-8x7B(总参数470亿,每个token活跃约129亿)和gpt-oss-120b(总参数1200亿,每个token活跃≤200亿)都是混合专家模型;我们的≤200亿阈值指的是**前向传播中的活跃参数**,它们决定了每查询的功耗和延迟。总参数量决定了存储需求:在FP4精度下,Mixtral-8x7B可在24GB GDDR6(Quadro RTX 6000)内存中运行,gpt-oss-120b可在128GB统一内存(Apple M4 Max)中运行。
(3)(Q3)我们表明,与批处理云基线相比,混合本地-云路由在能源、计算和成本方面实现了60%–80%的减少;即使是一个准确率为80%的路由器(一个现实的目标)也能捕获约80%的预言机收益,同时保持答案质量。
这些发现共同确立了本地推理作为集中式基础设施的实用补充,其可行性正在持续扩大。
## 2 预备知识
我们形式化本地和云推理基础设施,并引入度量智能效率的指标。
**推理基础设施:查询、模型与加速器。** 我们考虑一个推理基础设施服务一系列用户查询 $\mathcal{Q} = \{q_1, q_2, \ldots, q_n\}$,其中每个查询 $q_i$ 代表一个用户生成的请求(例如,聊天消息、推理任务)。令 $\mathcal{M}_{\text{local}} = \{m_1, \ldots, m_k\}$ 表示一组**本地LM**,每个的活跃参数≤200亿;$\mathcal{M}_{\text{cloud}} = \{M_1, \ldots, M_{\ell}\}$ 表示**前沿LM**,参数≥1000亿。类似地,令 $\mathcal{H}_{\text{local}}$ 表示**本地加速器**(例如Apple M4, AMD Ryzen),$\mathcal{H}_{\text{cloud}}$ 表示**云加速器**(例如NVIDIA H200, AMD MI300X)。我们根据活跃参数而非总参数定义 $\mathcal{M}_{\text{local}}$,因为每次查询的推理效率取决于前向传播中涉及的参数;总参数量决定存储需求,这是我们在每个加速器上验证的独立约束。
**推理服务:本地与云。** 我们区分两种推理范式:**本地推理**,查询由模型 $m \in \mathcal{M}_{\text{local}}$ 在加速器 $h \in \mathcal{H}_{\text{local}}$ 上处理;**云推理**,查询由模型 $M \in \mathcal{M}_{\text{cloud}}$ 在加速器 $H \in \mathcal{H}_{\text{cloud}}$ 上处理。一个路由函数 $r: \mathcal{Q} \rightarrow \mathcal{M}_{\text{local}} \cup \mathcal{M}_{\text{cloud}}$ 将每个查询分配给本地模型(最多200亿活跃参数)或云模型(至少1000亿参数)。
**智能效率指标。** 我们引入一系列指标来量化推理系统将能量转换为有用计算的效率。对于模型-加速器对 $(m, h)$,令 $\text{acc}(m, q)$ 表示模型 $m$ 在查询 $q$ 上的准确率,$\text{ppl}(m, q)$ 表示困惑度,$P(m, h, q)$ 表示处理查询 $q$ 期间的平均功耗(瓦特),$\tau(m, h, q)$ 表示生成响应的总延迟(秒),包括预填充和解码阶段。我们定义四个互补的效率指标:
**基于功耗的指标** 衡量相对于瞬时功耗的效率:
- • **每瓦准确率 (APW):** $\text{APW}(m, h) = \frac{\mathbb{E}_{q \sim \mathcal{Q}}[\text{acc}(m, q)]}{\mathbb{E}_{q \sim \mathcal{Q}}[P(m, h, q)]}$
- • **每瓦困惑度 (PPW):** $\text{PPW}(m, h) = \frac{1}{\mathbb{E}_{q \sim \mathcal{Q}}[\text{ppl}(m, q)] \cdot \mathbb{E}_{q \sim \mathcal{Q}}[P(m, h, q)]}$
**基于能耗的指标** 衡量相对于每查询总能耗的效率:
- • **每焦耳准确率 (APJ):** $\text{APJ}(m, h) = \frac{\mathbb{E}_{q \sim \mathcal{Q}}[\text{acc}(m, q)]}{\mathbb{E}_{q \sim \mathcal{Q}}[P(m, h, q) \cdot \tau(m, h, q)]}$
- • **每焦耳困惑度 (PPJ):** $\text{PPJ}(m, h) = \frac{1}{\mathbb{E}_{q \sim \mathcal{Q}}[\text{ppl}(m, q)] \cdot \mathbb{E}_{q \sim \mathcal{Q}}[P(m, h, q) \cdot \tau(m, h, q)]}$
其中 $P(m, h, q) \cdot \tau(m, h, q)$ 表示处理查询 $q$ 的能耗(焦耳)。
基于功耗的指标(APW, PPW)捕捉推理系统的瞬时效率,反映硬件在给定功耗下交付性能的能力。基于能耗的指标(APJ, PPJ)捕捉每查询的总效率,同时考虑功耗和生成延迟。这些指标共同提供了推理效率的全面视图:**每瓦智能**量化了模型-加速器对的稳态效率,而**每焦耳智能**量化了用户视角下的端到端效率,包括生成的时间成本。我们在整篇论文中报告所有四个指标的结果(表2,图3和8,表13–14),以确保结论对公式选择不敏感;相对排名和定性趋势在IPW、IPJ、PPW和PPJ之间得以保持,而绝对变化率则以有信息量的方式有所不同(例如,每焦耳增益超过每瓦增益,因为硬件进步同时降低了功耗和生成延迟)。
在正文中,我们将**准确率**作为二元指示符 $\text{acc}(m, q) \in \{0, 1\}$:对于具有标准答案的基准测试(MMLU Pro, SuperGPQA, NaturalReasoning),我们使用精确匹配正确性;对于开放式聊天查询(Wildchat),我们遵循聊天评估中的既定实践\[14\],当LLM-法官判定为 \[\[A > B\]\], \[\[A >> B\]\] 或 \[\[A = B\]\](即本地模型获胜或打平)时,定义 $\text{acc}(m, q) = 1$。
## 3 数据集与分析工具
在本节中,我们提供关于数据集选择和分析工具的详细信息。
### 3.1 数据集选择
**查询策划** 我们策划了超过100万条查询,涵盖四个互补的基准测试,旨在衡量自然部署场景和受控能力评估。为了确保我们关于本地推理效率的发现能够跨任务分布推广,我们将反映真实LLM使用模式的自然查询与标准化基准测试相结合,以支持跨领域系统性评估知识广度和推理能力。
对于**自然聊天任务**,查询来自Wildchat\[20\]:一个包含100万真实ChatGPT提示的数据集,涵盖1个月的用户流量。
对于**通用推理任务**,查询来自NaturalReasoning\[87\],提供大约120万条侧重推理的查询,涵盖数学、物理和化学等多样化领域。
对于**标准化知识评估**,我们使用MMLU Pro\[80\]:MMLU的增强版本,具有更高的难度(10个答案选项 vs. 4个)和对提示变化更强的鲁棒性,衡量多领域知识理解。
对于**跨专业学科的专家级推理**,我们在SuperGPQA\[59\]上进行评估:一个专注于博士生水平科学问题的数据集。相似文章
AI 与效率
# AI 与效率 来源: [https://openai.com/index/ai-and-efficiency/](https://openai.com/index/ai-and-efficiency/) 训练到 AlexNet 水平性能所需的总计算量(万亿浮点运算次/秒-天)。任意给定时间的最低计算点以蓝色显示,所有测量点以灰色显示。[2](https://openai.com/index/ai-and-efficiency/#citation-bottom-2),[5](https://openai.com/index/ai-and-efficiency/#citation-bottom-5),[6](https://openai.com/index/ai-and-efficiency/#citation-bottom-6),
AMD的小型AI PC预示着模型推理向本地化未来的转变
AMD的Ryzen AI Max平台配备128GB统一内存,可本地推理高达2000亿参数的大模型,旨在将AI工作负载从云端转移到紧凑的个人硬件上。
本地模型是否比预期更快变得“足够好”?
这篇文章讨论了本地AI模型在日常任务中日益增长的可行性,暗示了向混合架构的转变,这种架构优化成本和延迟,而不是仅仅依赖前沿的云模型。
@LambLabs:Lamb Labs(YC S26)正在构建定制AI推理芯片,可实现20,000+ tok/s的速度,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍……
Lamb Labs(YC S26)宣布推出定制AI推理芯片,声称速度可达20,000+ tok/s,且每瓦特智能(Intelligence per Watt)比传统GPU高63倍,并指出GPU之所以被广泛采用是因为其可用性,而非其适用性。
2026年中本地模型
2026年中本地AI模型的技术概览,重点介绍开放权重模型如何通过混合专家模型和稀疏注意力机制的进步缩小了与前沿模型的差距,从而实现高效的本地推理。