一刀切不适用:从部署实际提问中设置推理深度

arXiv cs.CL 论文

摘要

本文提出一种方法,基于部署过程中遇到的实际问题动态设置AI模型的推理深度,以提高计算效率。

arXiv:2609.14144v1 Announce Type: new 摘要:一个Transformer语言模型被训练来响应任何提示,但每个部署只处理有限范围的问题:客服助手看到的是物流投诉,编程工具看到的是Python。尽管如此,每个部署都为每个token支付相同的计算成本。本文测量当提示范围提前已知时,有多少成本可以避免。 研究的机制是早期退出:一个小型的、经过训练的组件——称为读出组件——连接到中间层并提议一个token,然后通过置信度测试决定是否输出该token或运行剩余层。模型是固定的,唯一的监督是模型自身在普通流量上的输出。 报告了三个发现。首先,可实现的节省强烈依赖于流量类型:在15亿参数模型上,半深度下,对于算术文字题,96%的token可以提前输出,而对于中文解释,只有8%,在匹配全模型的token级保真度下(该度量的局限性在第三个发现中暴露)。其次,在部署可能利用其流量知识的三种方式中,只有自定义提前退出阈值是有价值的:为每个部署校准阈值在三个模型上将退出率提高了多达59个百分点,在大多数测试语料库上提高了超过10个百分点。第三,token级保真度——早期退出文献中的标准评估度量——在token可以依据真实情况检查的领域失败:对于算术文字题,三个模型在完整运行时各正确回答了六十个问题,在早期退出下正确回答了10到28个,在保真度得分最高的配置下。 预期的设置是个人设备上的小模型,其中生成受限于内存带宽而非计算。
查看原文
查看缓存全文

缓存时间: 2026/09/15 08:49

# 并非一刀切:根据实际部署需求确定推理深度
来源:https://arxiv.org/abs/2609.14144
文献工具

## 文献与引用工具

文献探索器切换开关

代码、数据、媒体

## 与本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于arXivLabs

## arXivLabs:与社区协作者共同探索的实验性项目

arXivLabs是一个框架,允许协作者直接在我们的网站上开发和分享新的arXiv功能。

无论是个人还是组织,使用arXivLabs的合作者都认同并接受我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于践行这些价值观,仅与遵守这些原则的合作伙伴开展合作。

有一个能为arXiv社区创造价值的项目构想?**进一步了解arXivLabs**(https://info.arxiv.org/labs/index.html)。

相似文章

AI推理遵循着截然不同的规则(9分钟阅读)

TLDR AI

文章指出AI推理对云数据基础设施提出了独特挑战,其需求更接近高并发OLTP系统,而非传统面向人类速度的应用。文章强调需要优化存储和数据访问层,以应对自主智能体驱动的"AI数据海啸"。

当前AI最大的瓶颈在于部署层的模型迭代

Reddit r/artificial

文章指出,当前生产环境中AI的最大瓶颈并非初始模型部署,而是持续的迭代周期——将生产使用(推理日志、用户反馈)转化为用于微调和重新部署的数据集。文章强调了构建集成反馈循环而非一次性项目的重要性。