on-device-llm

标签

Cards List
#on-device-llm

关键词至关重要:揭示端侧大语言模型提示词的能量敏感性

arXiv cs.AI · 6天前 缓存

本文通过实验研究提示词表述如何影响端侧大语言模型的能耗,表明关键词选择会显著影响解码长度和总能耗,并提示工程可作为轻量级能耗优化手段。

0 人收藏 0 人点赞
#on-device-llm

Quant.npu:通过全静态量化实现端侧大语言模型的高效移动NPU推理

arXiv cs.LG · 2026-05-21 缓存

Quant.npu 提出了一种面向移动 NPU 的全静态量化框架,利用可学习参数和旋转矩阵,无需运行时重新计算即可实现高效的低比特大语言模型推理,延迟最高降低 15.1%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈