llm-decoding

标签

Cards List
#llm-decoding

Chopthin-共识功率采样:一种保持多样性的大语言模型解码方法

arXiv cs.CL · 2026-09-14 缓存

Chopthin-共识功率采样(CCPS)是一种用于大语言模型解码、保持多样性的方法,它通过保留不同的推理路径并采用语义多数选择,无需后训练即可提高推理准确性,这在基准测试中得到了验证。

0 人收藏 0 人点赞
#llm-decoding

LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization

arXiv cs.CL · 2026-08-11 缓存

Presents LibraSpec, a training-free, plug-and-play algorithm that dynamically selects speculative decoding lengths via marginal-gain-driven optimization, achieving consistent speedups across multiple models and benchmarks.

0 人收藏 0 人点赞
#llm-decoding

ART:高效大语言模型解码中的注意力运行时终止

arXiv cs.CL · 2026-06-02 缓存

本文提出ART,一种轻量级的运行时机制,它在LLM解码过程中追踪累积的注意力输出,并在进一步贡献变得微不足道时终止不必要的KV块访问,从而在保持相当精度的同时实现20%更高的生成吞吐量。

0 人收藏 0 人点赞
#llm-decoding

GQLA: 面向硬件自适应大语言模型解码的分组查询潜在注意力

arXiv cs.LG · 2026-05-18 缓存

GQLA 提出了对多头潜在注意力(MLA)的极小修改,在相同训练权重上同时暴露 MQA 吸收路径和 GQA 路径,从而无需重新训练即可实现硬件自适应解码。该方法压缩 KV 缓存并支持张量并行性,通过将 LLaMA-3-8B 从 GQA 转换为 GQLA 得到验证。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈