口袋级推理基准测试
摘要
本文对iPhone 17 Pro上的AI推理性能进行基准测试,评估了生成时间、模型智能等指标在各种任务中的表现,以评估现实世界移动设备的使用情况。
暂无内容
查看缓存全文
缓存时间: 2026/08/30 03:40
# 消费级推理系统 | Artificial Analysis
来源:https://artificialanalysis.ai/hardware-inference-stack/mobile-phones
## 智能与推理性能摘要
### 平均分数(16K最大上下文)与端到端生成时间iPhone 17 Pro
五项评估的简单平均分,旨在反映真实世界移动设备使用场景:BFCL(子集)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500 · 上下文限制为16K token · 端到端时间指处理1024个token的提示并生成256个token响应所需秒数
这是一项简单的平均分,基于五项旨在反映真实世界移动设备使用场景的评估,针对能适配便携式硬件的小型模型运行,并由Artificial Analysis独立测量。详情请参阅方法论(https://artificialanalysis.ai/methodology/mobile-device-benchmark-set)。
处理1024个token的提示并生成256个token响应的总挂钟时间。请注意,这取决于所使用的硬件和模型架构,不包含模型表达冗长程度或多轮对话倾向的影响。
## 推理性能
### 端到端生成时间iPhone 17 Pro
处理1024个token的提示并生成256个token响应所需秒数 · 数值越低越好
处理1024个token的提示并生成256个token响应的总挂钟时间。请注意,这取决于所使用的硬件和模型架构,不包含模型表达冗长程度或多轮对话倾向的影响。
## 模型智能
### 平均分数(移动设备基准集,16K最大上下文)iPhone 17 Pro
五项评估的简单平均分,旨在反映真实世界移动设备使用场景:BFCL(子集)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500 · 上下文限制为16K token · 数值越高越好
因模型无法适配此设备或超出时间限制,性能测量已省略
这是一项简单的平均分,基于五项旨在反映真实世界移动设备使用场景的评估,针对能适配便携式硬件的小型模型运行,并由Artificial Analysis独立测量。详情请参阅方法论(https://artificialanalysis.ai/methodology/mobile-device-benchmark-set)。
## Token效率
### 上下文预算超限
在该模型的所有评估运行中,因达到16K token限制而提前停止的生成次数 · 数值越低越好
## 评估细分
### 移动设备基准集评估(16K最大上下文)iPhone 17 Pro
由Artificial Analysis独立测量的智能评估 · 上下文限制为16K token · 数值越高越好
BFCL
工具调用(索引子集)
IFBench
指令遵循
AA-Omniscience 准确率
知识
AA-Omniscience 非幻觉率
1 - 幻觉率
GPQA Diamond
科学推理
MATH-500
定量推理
相似文章
3970亿参数AI成功运行于iPhone
一个3970亿参数的AI模型已成功在iPhone上运行,展示了使用混合专家设计的设备端AI能力,尽管在速度、存储和散热方面面临挑战。
@yoheinakajima:刚在我的手机(17 Pro)上运行了这个
RunAnywhere 发布了一款设备端 AI 基准测试应用,可让用户直接在自己的手机上测量模型性能,用实时测试取代发布的数据。
@cpaik: 开源设备端多模型推理
一款用于在本地设备上运行多个AI模型推理的开源工具,可提升设备端AI部署效率。
苹果发布全新 Apple Silicon 端侧推理引擎
苹果在 WWDC 上发布了 CoreAI,这是一款适用于 Apple Silicon 的全新端侧推理引擎,将取代 CoreML,并通过优化推理支持多达 200 亿参数的更大模型,重点面向手机和平板设备。
本地iPhone AI图像生成正变得实用 - 每张图片仅需3秒
基准测试显示,在iPhone上本地运行Stable Diffusion 1.5,使用Realistic Vision V5.1 Hyper等优化模型,生成512x512图像最快仅需3.1秒,使得设备端AI图像生成变得切实可行。