在8美元微控制器上运行2890万参数的大语言模型
摘要
一位开发者演示了如何在仅8美元的ESP32-S3微控制器上运行一个2890万参数的语言模型,利用Google的逐层嵌入技术将大部分参数存储在闪存中,实现了设备端每秒约9.5个token的文本生成速度。
暂无内容
查看缓存全文
缓存时间: 2026/07/25 23:12
开放求职 · X slvDev · LinkedIn
相似文章
我在ESP32 Dev Kit V1上运行了完整的LLM模型(仅用81KB内存)
一位开发者成功在ESP32 Dev Kit V1上运行了量化至INT4的520万参数MoE LLM,仅使用81KB SRAM,通过从闪存流式加载专家,实现了约每秒5个token的速度。
在8美元的ESP32-S3上训练的SLM
Qapla'是一个项目,演示了在8美元的ESP32-S3微控制器上从头训练一个小型Transformer语言模型,表明无需GPU或数据中心即可实现设备端训练。
Echo Dot 2 能以不错的速度运行 28M 参数 LLM
一位开发者展示了如何使用 llama.cpp 在 Amazon Echo Dot 2 上本地运行 28M 参数 LLM,生成速度约 4 tokens/s,通过提示缓存实现约 2.3 秒延迟,从而支持简单的离线语音命令。
MiniCPM4:面向终端设备的超高效大语言模型
MiniCPM4 是一款专为终端设备设计的高效大语言模型,通过稀疏注意力、数据筛选、训练算法和推理系统等方面的创新,在0.5B和8B参数版本上实现了强大性能。
我从头开发了自己的量化大语言模型,使用300亿个token进行训练,部署大小仅为60 MB [R]
一位开发者从头创建了一个250M参数的量化大语言模型,使用300亿个token进行训练,可在CPU上以60 MB部署,并采用了一种新颖的基于磁盘的长上下文系统,支持最多1亿个token。