研究机器翻译高效推理部署中的量化权衡
摘要
本文研究了在单块GPU上部署EuroLLM和Hy-MT2等翻译模型时的量化权衡,表明将文档分块策略与W4A8/W8A8量化相结合能够改善延迟-吞吐量权衡,同时引入文档级评估来考察长上下文动态。
arXiv:2607.29397v1 公告类型:新
摘要:在真实服务器环境中部署大型语言模型面临挑战,因为系统需要在低延迟下提供高质量响应。量化是减少内存占用并提高推理效率的常用方法,但其对延迟和吞吐量的影响很少在受控的工作流级负载下进行评估。在本工作中,我们研究了两个翻译模型系列EuroLLM \citep{martins2025eurollm}和Hy-MT2 \citep{zheng2026hy}的量化权衡,涵盖从1.7B到22B的五种模型,以实现在单块A100或H100 GPU上的高效部署。我们证明了将文档分块策略与W4A8或W8A8量化相结合,可以在广泛的负载条件下改善延迟-吞吐量帕累托曲线。此外,由于标准机器翻译(MT)基准依赖于孤立的句子,无法捕捉长上下文动态,我们引入了来自WMT24++的文档级评估,以考察文本分块策略在量化条件下如何影响翻译质量。我们的结果显示,标准的片段级评估可能无法预测量化与长上下文文档翻译之间的交互。Hy-MT2在量化下仍然稳健,而EuroLLM表现出强烈的敏感性,翻译质量在所有考虑的量化格式下都会迅速崩溃。总体而言,我们的实验表明,推理效率与翻译质量之间的权衡不仅取决于量化格式,还取决于文本分块策略的选择。
查看缓存全文
缓存时间: 2026/08/03 07:36
# 研究机器翻译高效推理部署中的量化权衡
来源:https://arxiv.org/abs/2607.29397
查看 PDF(https://arxiv.org/pdf/2607.29397)
> 摘要:在真实的服务器环境中部署大型语言模型面临诸多挑战,因为系统需要以低延迟提供高质量响应。量化是一种常见的减少内存占用并提高推理效率的方法,但其对延迟和吞吐量的影响很少在受控的、编排层面(orchestration-level)的工作负载下进行评估。在这项工作中,我们研究了两个翻译模型系列——EuroLLM \citep{martins2025eurollm} 和 Hy-MT2 \citep{zheng2026hy}——的量化权衡,涵盖从 1.7B 到 22B 的五个模型,以实现在单个 A100 或 H100 GPU 上的高效部署。我们证明,将文档分块策略与 W4A8 或 W8A8 量化相结合,可以在广泛的工作负载下改善延迟-吞吐量帕累托曲线。此外,由于标准机器翻译(MT)基准依赖于孤立的句子,无法捕捉长上下文动态,我们引入了来自 WMT24++ 的文档级评估,以评估文本分块策略在量化条件下如何影响翻译质量。我们的结果表明,标准的片段级评估可能无法预测量化与长上下文文档翻译之间的交互。虽然 Hy-MT2 在量化下保持稳健,但 EuroLLM 表现出强烈的敏感性,翻译质量在所有考虑的量化格式下都会迅速崩溃。总的来说,我们的实验表明,推理效率与翻译质量之间的权衡不仅取决于量化格式,还取决于文本分块策略的选择。
## 提交历史
来自:Jim Zhao \[查看电子邮件(https://arxiv.org/show-email/b19a3c83/2607.29397)\] **\[v1\]** 2026 年 7 月 31 日(周五)13:15:11 UTC(263 KB)相似文章
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
重新思考小型VLM量化:从组件分析到硬件感知的边缘部署
本文系统性地评估了Jetson边缘设备上小型视觉语言模型的组件级量化,发现模型架构(MoE vs 稠密)显著影响量化敏感性,且量化误差在大体上是累加的,除了模态对齐路径之外。
CompactQE: 通过小型开放权重LLMs实现可解释的翻译质量评估
本文证明,小型开放权重LLMs(参数小于30B)能够实现具有竞争力的可解释翻译质量评估,包括MQM错误标注和修正,与更大的专有模型相媲美,同时保护数据隐私。
通过联合优化架构与量化策略实现 LLM 压缩
来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。
@akshay_pachaar: 如果必须将70B模型适配到单个GPU上,我会学习的LLM量化技术:(收藏此帖) FP16的70B模型……
一条推文介绍了五种关键的LLM量化技术(RTN, GPTQ, AWQ, LLM.int8(), QAT),用于在有限硬件上适配大型模型,并引用了一篇综合性研究论文。