文献综述:边缘端LLM推理:持续负载下移动设备、NPU和GPU的性能效率权衡 | 手机上LLM的Bnechmarking [R]
摘要
本文献综述分析了持续负载下移动设备、NPU和GPU上LLM推理的性能效率权衡,重点关注手机上LLM的基准测试。
暂无内容
相似文章
利用移动NPU的高效端侧扩散大语言模型推理
本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。
本地LLM推理优化:完整指南
一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。
Quant.npu:通过全静态量化实现端侧大语言模型的高效移动NPU推理
Quant.npu 提出了一种面向移动 NPU 的全静态量化框架,利用可学习参数和旋转矩阵,无需运行时重新计算即可实现高效的低比特大语言模型推理,延迟最高降低 15.1%。
文献综述:MELTing point:移动设备上语言Transformer的评估 | 在手机上基准测试LLMs
本文献综述介绍了MELT,这是一个用于在移动设备上评估大语言模型(LLMs)的基准测试,突显了在手机上运行Transformer的挑战与机遇。
@polynoamial: https://x.com/polynoamial/status/2064210146558136827
本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。