基于自监督早期退出机制加速大语言模型推理
摘要
本文介绍了一种针对大语言模型的自监督早期退出方法,允许在置信度较高时在中间层提前停止计算,从而降低推理成本。此外,还提出了动态自推测解码(DSSD),相比现有基线实现了更高的令牌接受率。
arXiv:2407.21082v3 公告类型: 替换
摘要: 本文提出了一种模块化方法,通过在中间Transformer层添加早期退出头来加速大语言模型推理。每个头以自监督方式训练,模拟主模型的预测,当达到校准的置信度阈值时即可提前停止计算。我们评估了多种置信度指标,结果表明熵在区分正确与错误预测方面最为可靠。在Pythia模型套件(70M至2.8B参数)上的实验表明,我们的方法在多个基准测试中显著降低了推理成本,同时保持了准确性。我们进一步将该方法应用于推测解码,提出了动态自推测解码(DSSD),与手动调优的LayerSkip基线相比,仅需极少的超参数调优即可实现1.66倍更高的令牌接受率。
查看缓存全文
缓存时间: 2026/07/13 08:00
# 通过自监督早期退出加速大语言模型推理 来源: https://arxiv.org/abs/2407.21082 ## 计算机科学 > 计算与语言 **arXiv:2407.21082**(计算机科学) 提交于 2024年7月30日 [v1 (https://arxiv.org/abs/2407.21082v1)],最后修订于 2026年7月10日(当前版本 v3) 查看 PDF (https://arxiv.org/pdf/2407.21082) > 摘要:本文提出一种模块化方法,通过在中间 Transformer 层添加早期退出头来加速大语言模型(LLM)的推理。每个头以自监督方式训练,以模仿主模型的预测,从而在达到校准的置信度阈值时能够提前停止计算。我们评估了多种置信度指标,结果表明熵在区分正确与错误预测方面最为可靠。在 Pythia 模型系列(70M 到 2.8B 参数)上的实验表明,我们的方法在多个基准测试中显著降低推理成本的同时保持了准确率。我们进一步将该方法适配到推测解码中,提出了动态自推测解码(DSSD),在最小超参数调优的情况下,其 token 接受率比手动调优的 LayerSkip 基线高出 1.66 倍。 ## 提交历史 来自:Florian Valade [查看邮件 (https://arxiv.org/show-email/5fa99cf3/2407.21082)] [通过 CCSD 代理] **[v1](https://arxiv.org/abs/2407.21082v1)** 2024年7月30日 星期二 07:58:28 UTC(7,190 KB) **[v2](https://arxiv.org/abs/2407.21082v2)** 2026年2月12日 星期四 09:41:15 UTC(8,307 KB) **v3** 2026年7月10日 星期五 12:19:50 UTC(1,154 KB) 文献工具 ## 文献与引用工具 文献浏览器 切换 代码、数据、媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作者的实验项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织都已接受并认可我们关于开放性、社区、卓越和用户数据隐私的价值观。arXiv 致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有能为 arXiv 社区带来价值的项目创意吗?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
基于强化学习的经验驱动式LLM动态退出策略
介绍了LEDE,一个利用离线强化学习动态选择退出层和推测长度的框架,用于LLM的自推测解码,相较于自回归解码实现了高达2.7倍的加速。
LEAP:通过前瞻早期收敛令牌检测释放 dLLM 并行潜力
本文介绍了 LEAP,这是一种无需训练的方法,旨在通过检测早期收敛令牌来加速扩散语言模型(dLLMs)的推理过程。该方法能在不损失准确性的前提下,将去噪步骤减少 30%。
大模型推理的二维早退优化
作者提出一种二维早退方法,同时裁剪层与输入句子,在 Llama 3.1/3.2、Gemma 与 Qwen 模型的情感任务上额外获得 1.4–2.3 倍加速。
River-LLM:基于 KV 共享的大模型无感早退方案
River-LLM 提出一种无需训练的 decoder-only 大模型早退框架,通过 KV 共享消除 KV-cache 缺口,在无损质量的前提下实现 1.71–2.16 倍推理加速。
基于时空并行解码与置信度外推的高效扩散LLMs
本文介绍了时空并行解码(TSPD)和置信度外推(CE),通过动态判断令牌何时收敛并预测logit趋势,来加速基于扩散的大语言模型的推理,减少不必要的去噪步骤,同时保持输出质量。