文献综述:边缘端LLM推理:持续负载下移动设备、NPU和GPU的性能效率权衡 | 手机上LLM的Bnechmarking [R]

Reddit r/LocalLLaMA 论文

摘要

本文献综述分析了持续负载下移动设备、NPU和GPU上LLM推理的性能效率权衡,重点关注手机上LLM的基准测试。

暂无内容
查看原文

相似文章

利用移动NPU的高效端侧扩散大语言模型推理

arXiv cs.LG

本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。

本地LLM推理优化:完整指南

Reddit r/LocalLLaMA

一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。