口袋级推理基准测试

Hacker News Top 新闻

摘要

本文对iPhone 17 Pro上的AI推理性能进行基准测试,评估了生成时间、模型智能等指标在各种任务中的表现,以评估现实世界移动设备的使用情况。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/30 03:40

# 消费级推理系统 | Artificial Analysis 来源:https://artificialanalysis.ai/hardware-inference-stack/mobile-phones ## 智能与推理性能摘要 ### 平均分数(16K最大上下文)与端到端生成时间iPhone 17 Pro 五项评估的简单平均分,旨在反映真实世界移动设备使用场景:BFCL(子集)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500 · 上下文限制为16K token · 端到端时间指处理1024个token的提示并生成256个token响应所需秒数 这是一项简单的平均分,基于五项旨在反映真实世界移动设备使用场景的评估,针对能适配便携式硬件的小型模型运行,并由Artificial Analysis独立测量。详情请参阅方法论(https://artificialanalysis.ai/methodology/mobile-device-benchmark-set)。 处理1024个token的提示并生成256个token响应的总挂钟时间。请注意,这取决于所使用的硬件和模型架构,不包含模型表达冗长程度或多轮对话倾向的影响。 ## 推理性能 ### 端到端生成时间iPhone 17 Pro 处理1024个token的提示并生成256个token响应所需秒数 · 数值越低越好 处理1024个token的提示并生成256个token响应的总挂钟时间。请注意,这取决于所使用的硬件和模型架构,不包含模型表达冗长程度或多轮对话倾向的影响。 ## 模型智能 ### 平均分数(移动设备基准集,16K最大上下文)iPhone 17 Pro 五项评估的简单平均分,旨在反映真实世界移动设备使用场景:BFCL(子集)、IFBench、AA-Omniscience、GPQA Diamond、MATH-500 · 上下文限制为16K token · 数值越高越好 因模型无法适配此设备或超出时间限制,性能测量已省略 这是一项简单的平均分,基于五项旨在反映真实世界移动设备使用场景的评估,针对能适配便携式硬件的小型模型运行,并由Artificial Analysis独立测量。详情请参阅方法论(https://artificialanalysis.ai/methodology/mobile-device-benchmark-set)。 ## Token效率 ### 上下文预算超限 在该模型的所有评估运行中,因达到16K token限制而提前停止的生成次数 · 数值越低越好 ## 评估细分 ### 移动设备基准集评估(16K最大上下文)iPhone 17 Pro 由Artificial Analysis独立测量的智能评估 · 上下文限制为16K token · 数值越高越好 BFCL 工具调用(索引子集) IFBench 指令遵循 AA-Omniscience 准确率 知识 AA-Omniscience 非幻觉率 1 - 幻觉率 GPQA Diamond 科学推理 MATH-500 定量推理

相似文章

3970亿参数AI成功运行于iPhone

Reddit r/ArtificialInteligence

一个3970亿参数的AI模型已成功在iPhone上运行,展示了使用混合专家设计的设备端AI能力,尽管在速度、存储和散热方面面临挑战。

苹果发布全新 Apple Silicon 端侧推理引擎

Reddit r/LocalLLaMA

苹果在 WWDC 上发布了 CoreAI,这是一款适用于 Apple Silicon 的全新端侧推理引擎,将取代 CoreML,并通过优化推理支持多达 200 亿参数的更大模型,重点面向手机和平板设备。