研究人员让AI智能体优化LLM推理,Token用量锐减70%

Reddit r/ArtificialInteligence 论文

摘要

研究人员开发了AutoTTS框架,通过AI智能体自动设计控制策略来优化LLM推理,在保持高推理准确率的同时,将Token消耗降低约70%。

研究人员通过让AI自行探索,找到了提升AI推理效率的方法。他们构建了一个环境,让AI智能体在其中编写控制器代码、进行测试、获取反馈并不断迭代重写,直到策略得到优化。最终结果显示,在达到与运行64条并行推理链相同准确率的情况下,Token用量减少了约70%。该研究由来自UMD、UVA、WUSTL、UNC、Google和Meta的联合团队完成。该方法名为AutoTTS(Automated Test-Time Scaling,自动化测试时扩展)。
查看原文
查看缓存全文

缓存时间: 2026/05/12 12:44

# AutoTTS:研究人员让 AI 自主编写策略,将推理 Token 消耗降低 70% - Firethering Source: https://firethering.com/autotts-ai-inference-test-time-scaling/ - 广告 - 研究人员想出了如何让 AI 更高效推理的方法:让 AI 自己摸索。通过构建一个环境,让 AI Agent 编写控制器代码,进行测试,获取反馈,并不断重写,直到策略性能持续提升。 结果显示,在与运行 64 条并行推理链精度相当的情况下,Token 消耗降低了约 70%。这直接决定了推理成本是“负担得起”还是“成为财务负担”。 这项研究由来自 UMD、UVA、WUSTL、UNC、Google 和 Meta 的团队合作完成。它被称为 AutoTTS(Automated Test-Time Scaling,自动化测试时扩展),这是今年发表的概念上最有趣的研究之一,即使你明天还无法下载模型直接使用。 ## **它的核心发现** 要从推理模型中获得更好答案的标准做法是 brute force(暴力法)。将同一个问题并行输入模型 64 次,收集所有答案,然后选择最常见的那个。这确实有效,但代价高昂,每次查询的计算量都是原来的 64 倍。 AutoTTS 提出了一个不同的问题。与其运行更多并行链并寄希望于多数投票取胜,系统能否自动发现更聪明的策略,以决定何时分支、何时继续、何时停止,以及何时切断一条走入死胡同的推理路径? 它找到的答案被称为 Confidence Momentum Controller(置信度动量控制器)。CMC 不对推理做出固定决策(如固定分支次数或固定运行步数),而是观察模型在推理轨迹(reasoning traces)中的置信度变化,并基于趋势做出决策。 如果置信度持续上升,它会提前停止并给出答案。如果置信度停滞或下降,它会开启新分支进行探索。如果某个分支始终与正在形成的共识保持一致,它会获得更多计算资源。如果另一个分支持续偏离,它会被切断,但前提是该分支持续偏离,而不是因为单步失误。 CMC 并非由研究人员设计。它由 AI Agent 编写,针对缓存的推理轨迹进行测试,根据准确率和 Token 成本进行评估,并在多个回合中不断重写,直到性能不再提升。人类构建了环境,Agent 编写了策略。 ## **关键数据** 结果表在 β = 0.5 的运行点(速度与精度的平衡设置)下,AutoTTS 相比运行 64 条并行链,将 Token 消耗降低了约 69.5%。在四个不同尺寸的 Qwen3 模型上,其在保留基准测试(held-out benchmarks)上的准确率与 SC@64 持平。仅用 30% 的 Token 成本就达到了相同效果。 在 β = 1.0 的“精度优先”设置下,该自动发现的控制器在基准测试表 8 个对比项中的 5 项内,将峰值准确率推至超越所有人工设计基线的水平。更准确,且完全自动发现。 评估使用 AIME24 进行策略发现,并使用未参与搜索的 AIME25 和 HMMT25 进行测试。在一项基准测试上发现的控制器策略具有泛化能力,可直接迁移到系统搜索期间从未见过的其他基准测试上。对于那些怀疑这是否只是“基准测试过拟合”的人来说,这才是最重要的结果。 ## **工作原理** 该系统由两部分组成,值得深入了解,因为它的精妙之处正在于两者的结合方式。 首先,在进行任何策略发现之前,你需要离线收集推理轨迹。将模型在一系列问题上运行,保存每一条推理路径,并将每条路径切分为固定长度的片段。这就构成了你的 replay store(重放存储器),一个缓存了模型在数千个问题中实际推理过程的数据库。 其次,由 Claude Code Agent 编写控制器代码。控制器负责决策推理策略:何时分支、何时停止、何时探测推理路径、何时将其切断。Agent 在 replay store 上测试每个控制器,全程无需发起新的模型调用。所有数据均已缓存。一次完整的发现流程 API 调用成本为 $39.90,耗时 160 分钟。replay store 承担了大部分计算工作。 每一轮中,Agent 会收到准确率数据、Token 成本,以及控制器在每个问题上具体操作的详细轨迹(包括它在何处分支、何处停止、何处出错)。Agent 利用这些反馈重写控制器。循环往复多个回合,直到优化目标不再提升。 这本质上就是一个 Agent 在反馈循环中编写出越来越好的 Python 代码。离线收集过程针对每个模型和基准测试只需运行一次。此后,发现流程的成本足够低,一个研究团队一天内就能运行多次实验。 ##### **你可能也喜欢:**能在生成图像中精准渲染文字的开源 AI 模型 (https://firethering.com/best-open-source-ai-image-text-rendering-models/) ## **目前谁能真正使用它** 你无法明天就下载 AutoTTS 并直接集成到生产环境中。不存在什么预训练权重能让你现有的系统直接获得 70% 的 Token 削减效果。目前提供的只是一个研究框架、一个重放环境,以及自动发现的控制器代码。 要实际使用该方法,你需要从目标模型中收集自己的离线推理轨迹,即在感兴趣的基准测试上缓存数千条响应。你需要运行具备 API 访问权限的 Claude Code 来执行发现循环。你需要投入工程时间来搭建重放环境并评估结果。$39.90 的成本前提是这些基础设施已经就绪。 对于正在积极研究测试时计算(test-time compute)的机器学习研究员和推理工程师来说,这是立即可落地的。该框架是开源的,自动发现的 CMC 控制器已随代码库发布,可以在他们自己的重放数据上直接评估,甚至完全无需运行发现流程。 对于大多数通过 API 在前沿模型上层进行开发的开发者来说,这是一篇值得阅读和关注的论文。其中的理念很可能比你预期的更早出现在生产级推理系统中,但相关工程工作尚未完成。 ## **当策略开始自我编写** 迄今为止,每一次推理效率的提升都源于人类设计出更好的策略。AutoTTS 是首个公开的系统,其策略设计本身实现了自动化,且自动发现的策略性能超越了人工设计的策略。 这意味着推理效率研究将随着算力和重放数据的增长而扩展,而不是受限于能有多少研究人员能仔细思考该问题。 这还处于早期阶段。一篇论文,一个控制器,两个基准测试。但 AutoTTS 提出的问题——“AI 系统能否自动发现更优的方式来利用自身的智能?”——正是当前领域内最重要的问题之一。这篇论文至少为该问题的一个狭窄子集提供了一个可信的答案。 即使你今天还无法直接使用它,也绝对值得持续关注。

相似文章

@ihtesham2005: 如果你仍认为 AI 代理无法进行真正的研究,这篇论文将终结这一争论。来自谷歌和 Meta 的研究人员提出……

X AI KOLs Following

来自谷歌和 Meta 的研究人员提出了 AutoTTS 框架,该框架利用 AI 代理在没有人工干预的情况下,自动发现并优化大语言模型(LLM)的推理时缩放策略。该代理成功识别出了复杂的、协同工作的推理机制,在较低的计算成本下优于人工设定的基准。

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。