一刀切不适用:从部署实际提问中设置推理深度
摘要
本文提出一种方法,基于部署过程中遇到的实际问题动态设置AI模型的推理深度,以提高计算效率。
arXiv:2609.14144v1 Announce Type: new
摘要:一个Transformer语言模型被训练来响应任何提示,但每个部署只处理有限范围的问题:客服助手看到的是物流投诉,编程工具看到的是Python。尽管如此,每个部署都为每个token支付相同的计算成本。本文测量当提示范围提前已知时,有多少成本可以避免。
研究的机制是早期退出:一个小型的、经过训练的组件——称为读出组件——连接到中间层并提议一个token,然后通过置信度测试决定是否输出该token或运行剩余层。模型是固定的,唯一的监督是模型自身在普通流量上的输出。
报告了三个发现。首先,可实现的节省强烈依赖于流量类型:在15亿参数模型上,半深度下,对于算术文字题,96%的token可以提前输出,而对于中文解释,只有8%,在匹配全模型的token级保真度下(该度量的局限性在第三个发现中暴露)。其次,在部署可能利用其流量知识的三种方式中,只有自定义提前退出阈值是有价值的:为每个部署校准阈值在三个模型上将退出率提高了多达59个百分点,在大多数测试语料库上提高了超过10个百分点。第三,token级保真度——早期退出文献中的标准评估度量——在token可以依据真实情况检查的领域失败:对于算术文字题,三个模型在完整运行时各正确回答了六十个问题,在早期退出下正确回答了10到28个,在保真度得分最高的配置下。
预期的设置是个人设备上的小模型,其中生成受限于内存带宽而非计算。
查看缓存全文
缓存时间: 2026/09/15 08:49
# 并非一刀切:根据实际部署需求确定推理深度 来源:https://arxiv.org/abs/2609.14144 文献工具 ## 文献与引用工具 文献探索器切换开关 代码、数据、媒体 ## 与本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区协作者共同探索的实验性项目 arXivLabs是一个框架,允许协作者直接在我们的网站上开发和分享新的arXiv功能。 无论是个人还是组织,使用arXivLabs的合作者都认同并接受我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于践行这些价值观,仅与遵守这些原则的合作伙伴开展合作。 有一个能为arXiv社区创造价值的项目构想?**进一步了解arXivLabs**(https://info.arxiv.org/labs/index.html)。
相似文章
@svpino:如何将待解决问题的复杂性与合适的模型匹配。您需要一个推理路由器。
Svpino 演示了如何使用推理路由器将问题复杂性与适当的AI模型匹配,建议用户停止直接与模型交互。
AI推理遵循着截然不同的规则(9分钟阅读)
文章指出AI推理对云数据基础设施提出了独特挑战,其需求更接近高并发OLTP系统,而非传统面向人类速度的应用。文章强调需要优化存储和数据访问层,以应对自主智能体驱动的"AI数据海啸"。
当前AI最大的瓶颈在于部署层的模型迭代
文章指出,当前生产环境中AI的最大瓶颈并非初始模型部署,而是持续的迭代周期——将生产使用(推理日志、用户反馈)转化为用于微调和重新部署的数据集。文章强调了构建集成反馈循环而非一次性项目的重要性。
@rasbt: 推理扩展第1部分。从改进的文本生成函数开始(温度缩放、top-p过滤、多项式……
本文介绍了AI文本生成的推理扩展技术,如温度缩放、top-p过滤和自一致性,旨在通过多样化采样和多数投票将答案准确率提高两倍以上。
有没有人发现对于AI代理来说,上下文比模型大小更重要?
作者分享了构建AI代理的经验,发现提供清晰的上下文和指导(定义任务、规则和工具)比模型大小更能减少错误并提升性能。