微语言模型实现即时响应

Hugging Face Daily Papers 论文

摘要

研究人员推出 8M–30M 参数的微型语言模型,可在本地设备瞬间生成前几个词,再由云端模型补全,让智能手表等超受限设备也能拥有响应迅速的 AI 体验。

智能手表、智能眼镜等边缘设备因功耗与算力限制,无法持续运行哪怕最小的 100M–1B 参数语言模型;而云端推理又会带来数秒延迟,破坏“即时助手”的幻觉。我们提出微语言模型(μLM):仅 8M–30M 参数的极致轻量模型,可在本地瞬间生成 4–8 个贴合上下文的词,同时云端模型继续补全,从而掩盖网络延迟。实验表明,在这一极端尺度下仍可完成有用生成,我们的模型性能可媲美多款 70M–256M 参数的现有模型。我们设计了一种协同生成框架,将云端模型重新定位为“续写者”而非“回答者”,实现句中无缝交接,并通过三种纠错方法在本地开头出错时优雅恢复。实证结果显示,μLM 能够发起的响应可被更大模型无缝续写,证明数量级不对称协作切实可行,为极度资源受限设备解锁响应式 AI。模型检查点与演示已开源:https://github.com/Sensente/micro_language_model_swen_project
查看原文
查看缓存全文

缓存时间: 2026/04/22 14:41

论文页面 - 微语言模型实现即时响应

来源:https://huggingface.co/papers/2604.19642

摘要

微语言模型可在设备端瞬间启动响应,并由云端续写,借助边缘与云端的不对称协作,实现低延迟交互式 AI。

智能手表、智能眼镜等边缘设备受限于功耗与算力,无法持续运行哪怕最小的 100M–1B 参数语言模型;而云端推理(https://huggingface.co/papers?q=cloud%20inference)又会带来数秒延迟,破坏“助手秒回”的幻觉。我们提出微语言模型(https://huggingface.co/papers?q=micro%20language%20models)(μLM):极致压缩的 8M–30M 参数模型,可在设备端瞬时生成 4–8 个符合语境的词作为开场,再由云端大模型补全,从而掩盖云端延迟。实验证明,即使在如此极限规模下,语言生成依然可用——我们的模型性能媲美多款 70M–256M 参数的现有模型。我们设计了一套协作生成框架(https://huggingface.co/papers?q=collaborative%20generation%20framework),将云端模型重新定位为“续写者”而非“回答者”,实现句中无缝交接,并通过三种错误纠正方法(https://huggingface.co/papers?q=error%20correction%20methods)在本地开场出错时进行结构化优雅恢复。实证结果显示,μLM 发起的响应可被大模型无缝续写,证明数量级差异的不对称协作(https://huggingface.co/papers?q=asymmetric%20collaboration)完全可行,为极度资源受限设备解锁了“秒回”AI。模型权重与演示已开源:https://github.com/Sensente/micro_language_model_swen_project。

查看 arXiv 页面(https://arxiv.org/abs/2604.19642)
查看 PDF(https://arxiv.org/pdf/2604.19642)
GitHub(https://github.com/Sensente/micro_language_model_swen_project)
收藏论文(https://huggingface.co/login?next=%2Fpapers%2F2604.19642)

在智能体中阅读本文:

hf papers read 2604.19642

尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型引用该论文

在模型 README.md 中引用 arxiv.org/abs/2604.19642,即可在此页面显示链接。

引用本文的数据集 0

暂无数据集引用该论文

在数据集 README.md 中引用 arxiv.org/abs/2604.19642,即可在此页面显示链接。

引用本文的 Spaces 0

暂无 Space 引用该论文

在 Space README.md 中引用 arxiv.org/abs/2604.19642,即可在此页面显示链接。

收录本文的合集 0

暂无合集收录该论文

将本文加入新建合集,即可在此页面显示链接。

相似文章

在8美元微控制器上运行2890万参数的大语言模型

Hacker News Top

一位开发者演示了如何在仅8美元的ESP32-S3微控制器上运行一个2890万参数的语言模型,利用Google的逐层嵌入技术将大部分参数存储在闪存中,实现了设备端每秒约9.5个token的文本生成速度。

月光之味:面向边缘设备的小型专用ASR模型

Papers with Code Trending

本文介绍了“月光之味”(Flavors of Moonshine),一套面向边缘设备的小型专用ASR模型。作者证明,在人类标注、伪标注和合成数据的平衡混合上训练的单一语言模型,优于Whisper等更大的多语言模型,在小型模型中实现了最先进的错误率,并实现了对低资源语言的设备端ASR。