在8美元微控制器上运行2890万参数的大语言模型

Hacker News Top 工具

摘要

一位开发者演示了如何在仅8美元的ESP32-S3微控制器上运行一个2890万参数的语言模型,利用Google的逐层嵌入技术将大部分参数存储在闪存中,实现了设备端每秒约9.5个token的文本生成速度。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/25 23:12

开放求职 · X slvDev · LinkedIn

相似文章

在8美元的ESP32-S3上训练的SLM

Hacker News Top

Qapla'是一个项目,演示了在8美元的ESP32-S3微控制器上从头训练一个小型Transformer语言模型,表明无需GPU或数据中心即可实现设备端训练。

Echo Dot 2 能以不错的速度运行 28M 参数 LLM

Reddit r/LocalLLaMA

一位开发者展示了如何使用 llama.cpp 在 Amazon Echo Dot 2 上本地运行 28M 参数 LLM,生成速度约 4 tokens/s,通过提示缓存实现约 2.3 秒延迟,从而支持简单的离线语音命令。

MiniCPM4:面向终端设备的超高效大语言模型

Papers with Code Trending

MiniCPM4 是一款专为终端设备设计的高效大语言模型,通过稀疏注意力、数据筛选、训练算法和推理系统等方面的创新,在0.5B和8B参数版本上实现了强大性能。