文献综述:边缘端LLM推理:持续负载下移动设备、NPU和GPU的性能效率权衡 | 手机上LLM的Bnechmarking [R]

Reddit r/LocalLLaMA 论文

摘要

本文献综述分析了持续负载下移动设备、NPU和GPU上LLM推理的性能效率权衡,重点关注手机上LLM的基准测试。

暂无内容
查看原文

相似文章

利用移动NPU的高效端侧扩散大语言模型推理

arXiv cs.LG

本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。

本地LLM推理优化:完整指南

Reddit r/LocalLLaMA

一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。

LLM推理的有效前沿

Hacker News Top

本文解释了LLM推理中的有效前沿概念,涵盖了延迟、吞吐量和成本之间的权衡,并概述了在部署中管理或提高效率的技术。