在Celeron N5095单板计算机上进行纯CPU推理:从0.6B到8B的6个模型基准测试
摘要
本文对在Celeron N5095单板计算机上运行纯CPU推理的六个AI模型(参数规模从0.6B到8B)进行了基准测试,并提供了性能对比。
暂无内容
相似文章
花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。
作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。
AMD的小型AI PC预示着模型推理向本地化未来的转变
AMD的Ryzen AI Max平台配备128GB统一内存,可本地推理高达2000亿参数的大模型,旨在将AI工作负载从云端转移到紧凑的个人硬件上。
@liquidai:推出LFM2.5-230M:这是我们最小的模型,专为快速运行而设计,可在任何地方(CPU、NPU和GPU)上运行,以实现代理型任务…
Liquid AI发布了LFM2.5-230M,这是一个拥有230M参数的小型模型,针对CPU、NPU和GPU上的快速推理进行了优化,适用于手机和机器人等设备上的代理型任务。
@0xSero:本周最适合你硬件的模型。8-12GB - https://huggingface.co/LiquidAI/LFM2.5-8B-A1B… 令人难以置信的模型,如此快速,如此…
每周精选推荐最适合不同硬件配置(从8GB到768GB显存)的AI模型,突出性能与基准测试结果。
用纯C语言从零构建了一个BitNet推理引擎——在Xeon上比bitnet.cpp快1.8倍(36 tok/s),零依赖 [招募BitNet和Bonsai CPU测试者]
Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。