研究人员让AI智能体优化LLM推理,Token用量锐减70%
摘要
研究人员开发了AutoTTS框架,通过AI智能体自动设计控制策略来优化LLM推理,在保持高推理准确率的同时,将Token消耗降低约70%。
研究人员通过让AI自行探索,找到了提升AI推理效率的方法。他们构建了一个环境,让AI智能体在其中编写控制器代码、进行测试、获取反馈并不断迭代重写,直到策略得到优化。最终结果显示,在达到与运行64条并行推理链相同准确率的情况下,Token用量减少了约70%。该研究由来自UMD、UVA、WUSTL、UNC、Google和Meta的联合团队完成。该方法名为AutoTTS(Automated Test-Time Scaling,自动化测试时扩展)。
查看缓存全文
缓存时间: 2026/05/12 12:44
# AutoTTS:研究人员让 AI 自主编写策略,将推理 Token 消耗降低 70% - Firethering
Source: https://firethering.com/autotts-ai-inference-test-time-scaling/
- 广告 -
研究人员想出了如何让 AI 更高效推理的方法:让 AI 自己摸索。通过构建一个环境,让 AI Agent 编写控制器代码,进行测试,获取反馈,并不断重写,直到策略性能持续提升。
结果显示,在与运行 64 条并行推理链精度相当的情况下,Token 消耗降低了约 70%。这直接决定了推理成本是“负担得起”还是“成为财务负担”。
这项研究由来自 UMD、UVA、WUSTL、UNC、Google 和 Meta 的团队合作完成。它被称为 AutoTTS(Automated Test-Time Scaling,自动化测试时扩展),这是今年发表的概念上最有趣的研究之一,即使你明天还无法下载模型直接使用。
## **它的核心发现**
要从推理模型中获得更好答案的标准做法是 brute force(暴力法)。将同一个问题并行输入模型 64 次,收集所有答案,然后选择最常见的那个。这确实有效,但代价高昂,每次查询的计算量都是原来的 64 倍。
AutoTTS 提出了一个不同的问题。与其运行更多并行链并寄希望于多数投票取胜,系统能否自动发现更聪明的策略,以决定何时分支、何时继续、何时停止,以及何时切断一条走入死胡同的推理路径?
它找到的答案被称为 Confidence Momentum Controller(置信度动量控制器)。CMC 不对推理做出固定决策(如固定分支次数或固定运行步数),而是观察模型在推理轨迹(reasoning traces)中的置信度变化,并基于趋势做出决策。
如果置信度持续上升,它会提前停止并给出答案。如果置信度停滞或下降,它会开启新分支进行探索。如果某个分支始终与正在形成的共识保持一致,它会获得更多计算资源。如果另一个分支持续偏离,它会被切断,但前提是该分支持续偏离,而不是因为单步失误。
CMC 并非由研究人员设计。它由 AI Agent 编写,针对缓存的推理轨迹进行测试,根据准确率和 Token 成本进行评估,并在多个回合中不断重写,直到性能不再提升。人类构建了环境,Agent 编写了策略。
## **关键数据**
结果表在 β = 0.5 的运行点(速度与精度的平衡设置)下,AutoTTS 相比运行 64 条并行链,将 Token 消耗降低了约 69.5%。在四个不同尺寸的 Qwen3 模型上,其在保留基准测试(held-out benchmarks)上的准确率与 SC@64 持平。仅用 30% 的 Token 成本就达到了相同效果。
在 β = 1.0 的“精度优先”设置下,该自动发现的控制器在基准测试表 8 个对比项中的 5 项内,将峰值准确率推至超越所有人工设计基线的水平。更准确,且完全自动发现。
评估使用 AIME24 进行策略发现,并使用未参与搜索的 AIME25 和 HMMT25 进行测试。在一项基准测试上发现的控制器策略具有泛化能力,可直接迁移到系统搜索期间从未见过的其他基准测试上。对于那些怀疑这是否只是“基准测试过拟合”的人来说,这才是最重要的结果。
## **工作原理**
该系统由两部分组成,值得深入了解,因为它的精妙之处正在于两者的结合方式。
首先,在进行任何策略发现之前,你需要离线收集推理轨迹。将模型在一系列问题上运行,保存每一条推理路径,并将每条路径切分为固定长度的片段。这就构成了你的 replay store(重放存储器),一个缓存了模型在数千个问题中实际推理过程的数据库。
其次,由 Claude Code Agent 编写控制器代码。控制器负责决策推理策略:何时分支、何时停止、何时探测推理路径、何时将其切断。Agent 在 replay store 上测试每个控制器,全程无需发起新的模型调用。所有数据均已缓存。一次完整的发现流程 API 调用成本为 $39.90,耗时 160 分钟。replay store 承担了大部分计算工作。
每一轮中,Agent 会收到准确率数据、Token 成本,以及控制器在每个问题上具体操作的详细轨迹(包括它在何处分支、何处停止、何处出错)。Agent 利用这些反馈重写控制器。循环往复多个回合,直到优化目标不再提升。
这本质上就是一个 Agent 在反馈循环中编写出越来越好的 Python 代码。离线收集过程针对每个模型和基准测试只需运行一次。此后,发现流程的成本足够低,一个研究团队一天内就能运行多次实验。
##### **你可能也喜欢:**能在生成图像中精准渲染文字的开源 AI 模型 (https://firethering.com/best-open-source-ai-image-text-rendering-models/)
## **目前谁能真正使用它**
你无法明天就下载 AutoTTS 并直接集成到生产环境中。不存在什么预训练权重能让你现有的系统直接获得 70% 的 Token 削减效果。目前提供的只是一个研究框架、一个重放环境,以及自动发现的控制器代码。
要实际使用该方法,你需要从目标模型中收集自己的离线推理轨迹,即在感兴趣的基准测试上缓存数千条响应。你需要运行具备 API 访问权限的 Claude Code 来执行发现循环。你需要投入工程时间来搭建重放环境并评估结果。$39.90 的成本前提是这些基础设施已经就绪。
对于正在积极研究测试时计算(test-time compute)的机器学习研究员和推理工程师来说,这是立即可落地的。该框架是开源的,自动发现的 CMC 控制器已随代码库发布,可以在他们自己的重放数据上直接评估,甚至完全无需运行发现流程。
对于大多数通过 API 在前沿模型上层进行开发的开发者来说,这是一篇值得阅读和关注的论文。其中的理念很可能比你预期的更早出现在生产级推理系统中,但相关工程工作尚未完成。
## **当策略开始自我编写**
迄今为止,每一次推理效率的提升都源于人类设计出更好的策略。AutoTTS 是首个公开的系统,其策略设计本身实现了自动化,且自动发现的策略性能超越了人工设计的策略。
这意味着推理效率研究将随着算力和重放数据的增长而扩展,而不是受限于能有多少研究人员能仔细思考该问题。
这还处于早期阶段。一篇论文,一个控制器,两个基准测试。但 AutoTTS 提出的问题——“AI 系统能否自动发现更优的方式来利用自身的智能?”——正是当前领域内最重要的问题之一。这篇论文至少为该问题的一个狭窄子集提供了一个可信的答案。
即使你今天还无法直接使用它,也绝对值得持续关注。
相似文章
@ihtesham2005: 如果你仍认为 AI 代理无法进行真正的研究,这篇论文将终结这一争论。来自谷歌和 Meta 的研究人员提出……
来自谷歌和 Meta 的研究人员提出了 AutoTTS 框架,该框架利用 AI 代理在没有人工干预的情况下,自动发现并优化大语言模型(LLM)的推理时缩放策略。该代理成功识别出了复杂的、协同工作的推理机制,在较低的计算成本下优于人工设定的基准。
用 LLM 优化 LLM:面向测试时扩展的智能体发现方法
本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。
@pallavishekhar_: 如何减少AI代理中的Token使用?我们来理解一下。AI代理使用LLM进行思考、规划和推荐工具。每一步…
本帖子分享了减少AI代理中Token使用的策略,包括提示缓存、上下文摘要、使用较小模型、修剪工具输出、子代理、RAG以及紧凑的系统提示。
@tom_doerr: 无需训练即可提升 LLM 推理准确性 https://github.com/codelion/optillm…
OptiLLM 是一款开源推理代理,采用先进技术无需重新训练即可将 LLM 推理准确性提升高达 10 倍,兼容各种 AI API。
工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。