基于自监督早期退出机制加速大语言模型推理

arXiv cs.CL 论文

摘要

本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。

arXiv:2407.21082v3 公告类型: 替换 摘要: 本文提出了一种模块化方法,通过在中间Transformer层添加早期退出头来加速大语言模型推理。每个头以自监督方式训练,模拟主模型的预测,当达到校准的置信度阈值时即可提前停止计算。我们评估了多种置信度指标,结果表明熵在区分正确与错误预测方面最为可靠。在Pythia模型套件(70M至2.8B参数)上的实验表明,我们的方法在多个基准测试中显著降低了推理成本,同时保持了准确性。我们进一步将该方法应用于推测解码,提出了动态自推测解码(DSSD),与手动调优的LayerSkip基线相比,仅需极少的超参数调优即可实现1.66倍更高的令牌接受率。
查看原文
查看缓存全文

缓存时间: 2026/07/13 08:00

# 通过自监督早期退出加速大语言模型推理
来源: https://arxiv.org/abs/2407.21082
## 计算机科学 > 计算与语言

**arXiv:2407.21082**(计算机科学)

提交于 2024年7月30日 [v1 (https://arxiv.org/abs/2407.21082v1)],最后修订于 2026年7月10日(当前版本 v3)

查看 PDF (https://arxiv.org/pdf/2407.21082)

> 摘要:本文提出一种模块化方法,通过在中间 Transformer 层添加早期退出头来加速大语言模型(LLM)的推理。每个头以自监督方式训练,以模仿主模型的预测,从而在达到校准的置信度阈值时能够提前停止计算。我们评估了多种置信度指标,结果表明熵在区分正确与错误预测方面最为可靠。在 Pythia 模型系列(70M 到 2.8B 参数)上的实验表明,我们的方法在多个基准测试中显著降低推理成本的同时保持了准确率。我们进一步将该方法适配到推测解码中,提出了动态自推测解码(DSSD),在最小超参数调优的情况下,其 token 接受率比手动调优的 LayerSkip 基线高出 1.66 倍。

## 提交历史

来自:Florian Valade [查看邮件 (https://arxiv.org/show-email/5fa99cf3/2407.21082)] [通过 CCSD 代理] **[v1](https://arxiv.org/abs/2407.21082v1)** 2024年7月30日 星期二 07:58:28 UTC(7,190 KB) **[v2](https://arxiv.org/abs/2407.21082v2)** 2026年2月12日 星期四 09:41:15 UTC(8,307 KB) **v3** 2026年7月10日 星期五 12:19:50 UTC(1,154 KB)

文献工具

## 文献与引用工具

文献浏览器 切换

代码、数据、媒体

## 本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于 arXivLabs

## arXivLabs:与社区合作者的实验项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织都已接受并认可我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

有能为 arXiv 社区带来价值的项目创意吗?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。

相似文章

大模型推理的二维早退优化

arXiv cs.CL

作者提出一种二维早退方法,同时裁剪层与输入句子,在 Llama 3.1/3.2、Gemma 与 Qwen 模型的情感任务上额外获得 1.4–2.3 倍加速。

基于时空并行解码与置信度外推的高效扩散LLMs

arXiv cs.CL

本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。