@ihtesham2005: 如果你仍认为 AI 代理无法进行真正的研究,这篇论文将终结这一争论。来自谷歌和 Meta 的研究人员提出……

X AI KOLs Following 论文

摘要

来自谷歌和 Meta 的研究人员提出了 AutoTTS 框架,该框架利用 AI 代理在没有人工干预的情况下,自动发现并优化大语言模型(LLM)的推理时缩放策略。该代理成功识别出了复杂的、协同工作的推理机制,在较低的计算成本下优于人工设定的基准。

如果你仍认为 AI 代理无法进行真正的研究,这篇论文将终结这一争论。来自谷歌和 Meta 的研究人员构建了一个框架,让 Claude Code 自主提出提升 LLM 推理能力的算法,进行测试,并根据失败的情况进行迭代优化。在环境搭建完成后,全程无需人工介入。经过 5 轮迭代,该代理发现了一个包含四种协同工作机制的控制器:EMA 动量停止、耦合的宽度-深度控制、对齐感知深度分配、保守的分支放弃。论文明确指出:“这种协同复杂性仅靠人工直觉难以达成。”这是一种委婉的说法,暗示代理构建了人类可能想不到的方案。整个发现过程的总成本仅为 39.90 美元。一名研究员的咖啡预算竟超越了数年的人工微调工作。该论文由谷歌和 Meta 共同发布。请点击此处阅读:https://arxiv.org/abs/2605.08083
查看原文
查看缓存全文

缓存时间: 2026/05/13 12:23

如果你仍然认为 AI Agent 无法进行真正的科学研究,这篇论文将终结这场争论。来自 Google 和 Meta 的研究人员构建了一个框架,其中 Claude Code 提出自己的算法以改善大型语言模型(LLM)的推理能力,随后进行测试,并根据失败原因进行优化。在环境搭建完成后,全程无需人工干预。仅经过 5 轮迭代,Agent 就发现了一个包含 4 种协同机制的控制器:EMA 动量停止、耦合的宽度-深度控制、对齐感知的深度分配以及保守的分支放弃。论文中明确指出:“这种协同复杂性水平仅靠人工直觉很难达到。”这是一种委婉的说法,意思是 Agent 构建出了人类可能想不到的方案。整个发现过程的总成本仅为 39.90 美元。一位研究人员的咖啡预算就超过了数年手工调优的工作成果。该论文由 Google 和 Meta 共同发布。点击此处阅读:https://arxiv.org/abs/2605.08083


Agentic Discovery for Test-Time Scaling

来源:https://arxiv.org/html/2605.08083

LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling

Tong Zheng1, Haolin Liu2, Chengsong Huang3, Huiwen Bao, Sheng Zhang1, Rui Liu1, Runpeng Dai4, Ruibo Chen1, Chenxi Liu1, Tianyi Xiong1, Xidong Wu5, Hongming Zhang6 Heng Huang1 1UMD, 2UVA, 3WUSTL, 4UNC, 5Google, 6Meta

摘要

测试时缩放(Test-time Scaling, TTS)已成为一种通过在推理过程中分配额外计算资源来提升大型语言模型性能的有效方法。然而,现有的 TTS 策略大多是手工设计的:研究人员凭直觉手动设计推理模式并调整启发式规则,导致大部分计算分配空间未被探索。我们提出了一个环境驱动的框架 AutoTTS,改变了研究人员的设计对象:从设计单独的 TTS 启发式规则,转变为构建能够自动发现 TTS 策略的环境。AutoTTS 的核心在于环境构建:发现环境必须使控制空间易于处理,并为 TTS 搜索提供廉价且频繁的反馈。作为一个具体实例,我们将宽度-深度 TTS 公式化为在预先收集的推理轨迹和探针信号之上的控制器综合问题,其中控制器决定何时进行分支、继续、探测、剪枝或停止,并且可以在无需重复调用 LLM 的情况下以低成本进行评估。我们进一步引入了 beta 参数化以使搜索易于处理,并引入细粒度的执行轨迹反馈,帮助 Agent 诊断 TTS 程序失败的原因,从而提高发现效率。在数学推理基准测试上的实验表明,所发现的策略在整体准确性-成本权衡上优于强大的手动设计基线。所发现的策略能够泛化到保留基准测试和不同模型规模,而整个发现过程仅花费 39.9 美元和 160 分钟。我们的数据和代码将在 https://github.com/zhengkid/AutoTTS 开源。

参考图1图1:我们 Auto-TTS 框架的概述。与传统的手动设计 TTS 策略的工作流不同,Auto-TTS 将人类的角色从直接手工设计分支、剪枝和停止启发式规则,转变为通过定义状态、动作、反馈和目标来构建环境。给定构建好的环境,探索器 LLM 迭代地提出候选控制器,在离线重放环境中评估它们,接收来自缩放曲线和执行轨迹的反馈,并利用累积的历史记录优化未来的提案。右图展示了在 Qwen-1.7B 和 AIME25 上的评估示例,其中发现的控制器以一次性的可承受搜索成本,改进了相较于手工基线的准确性-成本帕累托前沿。

1 引言

参考图2图2:现有 TTS 算法作为宽度-深度控制空间中的特例。每种算法都描绘出一条独特的路径:SC@64 占据固定全额预算的一个角落;ASC 和 ESC 仅在最大深度沿宽度轴调整;Answer Consistency 仅在单条链上沿深度轴调整;ST-BoN 先广泛扩展,剪枝至一个分支,然后加深;Parallel-Probe 从广泛开始,在加深的过程中逐步剪枝。测试时缩放(TTS)已成为一种强大的范式,通过在推理过程中分配额外计算资源来提升大型语言模型的性能。然而,性能不仅取决于使用的计算量,还取决于计算资源的分配方式,而现有的分配策略大多是手工设计的:研究人员手动假设何时进行分支、加深、探测、剪枝或停止推理轨迹的启发式规则,实现它们,并凭直觉调整阈值。

回顾 TTS 策略的发展揭示了一个有价值的视角。尽管现有方法在形式上差异巨大,但其中许多可以解释为某个潜在计算分配空间中的手动指定策略。一个简单的例子是宽度-深度空间,其中“宽度”表示探索了多少个推理分支,“深度”表示每个分支发展到了多远,如图 2 所示。在这种视角下,几种代表性方法对应于该空间中的不同轨迹:一些方法通过采样更多推理分支来扩展宽度;一些方法通过延长推理轨迹来增加深度;还有一些方法引入自适应停止、剪枝或选择规则,以更选择性地穿过该空间。值得注意的是,这种视角并非旨在将所有 TTS 算法简化为二维抽象,因为许多方法涉及更丰富的结构,如树搜索或验证器引导的优化。相反,宽度-深度空间的案例表明,许多 TTS 策略可以被视为结构化控制空间中的手工设计特例。

这种视角建议对问题进行根本性的重构。在本工作中,我们提出了 AutoTTS,一种用于自动 TTS 策略发现的环境驱动范式(图 1)。AutoTTS 不再手工设计单独的分支、剪枝和停止启发式规则,而是将人类的角色转变为构建发现环境:人类通过状态、动作、反馈和目标定义控制空间,而 Agent 在此空间内搜索有效的分配策略。

作为一个概念验证实例,我们将宽度-深度测试时缩放(图 2)公式化为离线重放环境中的控制器综合问题。对于每个问题,我们预先收集推理轨迹和中间探针信号,允许控制器重放关于何时进行分支、继续、探测、剪枝或停止的决策。控制器观察活跃分支、它们的深度、揭示的探针输出以及剩余预算,并通过所得到的准确性-成本权衡进行评估。由于评估重用了预先收集的轨迹,候选控制器可以廉价且确定性地被评估,而无需反复调用基础 LLM。然而,有效的发现面临两个额外挑战:自动发现的控制器倾向于引入过多的超参数,使得搜索空间庞大,难以在有限轮次内导航;仅凭标量的准确性-成本反馈不足以告诉探索器控制器为何失败。

为了使控制器搜索易于处理,我们引入了 beta 参数化,其中每个控制器仅暴露一个标量权衡参数 \beta,并从中确定性派生所有内部超参数,减少对搜索集的过拟合。此外,我们通过记录执行轨迹来解决反馈问题,这些轨迹展示了每个控制器随时间分配计算资源的方式,使探索器能够诊断失败模式并提出针对性的改进。

在数学推理基准测试上的实验表明,AutoTTS 发现的控制器改进了准确性-成本帕累托前沿,优于强大的手工基线。所发现的控制器从搜索基准测试泛化到保留基准测试以及跨模型规模,而由于固定的重放,整个发现过程保持低成本。这些结果表明,环境驱动的发现在手动设计 TTS 策略方面提供了一种可扩展且可重用的替代方案,而投入人力精力的正确地方在于环境设计,而非策略设计。

2 将测试时缩放视为算法搜索

我们考虑自适应测试时算法,这些算法将推理预算分配给多个推理分支。对于每个问题 q,控制器在将探索的前缀聚合为最终答案之前,可以创建、扩展、探测和剪枝分支,涵盖诸如 Best-of-N、自我一致性、提前停止和自适应分支等策略。每个分支 i 产生前缀 z_{i,1}, z_{i,2}, \dots,其中 z_{i,k} 是在第 k 个固定长度生成间隔后获得的。每个前缀诱导一个中间答案 \omega_{i,k}(即从当前前缀产生的答案),仅当控制器在该分支明确采取探测动作时才能观察到。

由于我们将单位生成视为具有固定 token 长度的间隔,我们以间隔为单位衡量计算量。在决策步 t,设 m_t \in \mathbb{Z}_{\ge 0} 表示迄今为止实例化的分支数量,并使用约定 [m_t] = \{1, \dots, m_t\},其中 [0] = \emptyset。状态为 s_t = (q, m_t, I_t, \ell_t, Z_t, \Omega_t),其中 q \in \mathcal{Q} 是问题,I_t \subseteq [m_t] 是当前活跃分支的集合,\ell_t = (\ell_{t,i})_{i \in [m_t]} 记录每个实例化分支的当前深度,Z_t = (Z_{t,i})_{i \in [m_t]} 记录生成的前缀,\Omega_t 是迄今为止揭示的探针反馈集合。对于每个实例化分支 i \in [m_t]\ell_{t,i} \ge 1 表示在该分支上已生成多少个固定长度生成间隔,Z_{t,i} = (z_{i,1}, \dots, z_{i,\ell_{t,i}}) 包含分支 i 直到其当前深度生成的前缀。对于被剪枝的分支 i \in [m_t] \setminus I_t\ell_{t,i}Z_{t,i} 记录其被剪枝时的深度和生成的前缀。揭示的反馈集合满足 \Omega_t \subseteq \{(i, k, \omega_{i,k}) : i \in [m_t], 1 \le k \le \ell_{t,i}\}。未揭示的探针输出不属于控制器状态的一部分。状态的计算成本为 \text{Cost}(s_t) = \sum_{i=1}^{m_t} \ell_{t,i} + \kappa_{\text{probe}} \|\Omega_t\|,其中 \kappa_{\text{probe}} \ge 0 是读取一个探针信号的成本。在相对于生成被视为免费的设置中,我们设 \kappa_{\text{probe}} = 0

给定 s_t = (q, m_t, I_t, \ell_t, Z_t, \Omega_t),允许的动作集合为 \mathcal{A}(s_t) = \{\texttt{BRANCH}\} \cup \{\texttt{CONTINUE}(i) : i \in I_t\} \cup \{\texttt{PROBE}(i) : i \in I_t, \nexists \omega \text{ s.t. } (i, \ell_{t,i}, \omega) \in \Omega_t\} \cup \{\texttt{PRUNE}(i) : i \in I_t\} \cup \{\texttt{ANSWER}\}。这里 \texttt{BRANCH} 创建一个新的分支 m_t+1 并从问题推进到第一个间隔的结束。\texttt{CONTINUE}(i) 将分支 i 推进一个固定长度生成间隔。\texttt{PROBE}(i) 揭示当前探针信号 \omega_{i,\ell_{t,i}} 而不推进分支。\texttt{PRUNE}(i) 从活跃集合中移除分支 i,同时保留其当前信息。\texttt{ANSWER} 终止推理并调用聚合规则。聚合规则 \operatorname{Agg} 以状态为输入并输出最终答案。

形式上,初始状态是 s_0 = (q, 0, \emptyset, \emptyset, \emptyset)。如果 a_t = \texttt{BRANCH},则实例化一个新分支 m_t+1 并推进到第一个探针点,产生前缀 z_{m_t+1,1}。然后 m_{t+1} = m_t+1, I_{t+1} = I_t \cup \{m_t+1\}, \ell_{t+1} = (\ell_t, 1), Z_{t+1} = (Z_t, (z_{m_t+1,1})), 且 \Omega_{t+1} = \Omega_t。如果 a_t = \texttt{CONTINUE}(i),分支 i 推进一个间隔,产生前缀 z_{i,\ell_{t,i}+1}。然后 m_{t+1} = m_t, I_{t+1} = I_t, \Omega_{t+1} = \Omega_t, \ell_{t+1,j} = \ell_{t,j} + \mathbf{1}\{j=i\} 对所有 j \in [m_t] 成立,Z_{t+1,i} = (Z_{t,i}, z_{i,\ell_{t,i}+1}),且 Z_{t+1,j} = Z_{t,j} 对所有 j \neq i 成立。如果 a_t = \texttt{PROBE}(i),则 m_{t+1} = m_t, I_{t+1} = I_t, \ell_{t+1} = \ell_t, Z_{t+1} = Z_t,且 \Omega_{t+1} = \Omega_t \cup \{(i, \ell_{t,i}, \omega_{i,\ell_{t,i}})\}。如果 a_t = \texttt{PRUNE}(i),则 m_{t+1} = m_t, I_{t+1} = I_t \setminus \{i\}, \ell_{t+1} = \ell_t, Z_{t+1} = Z_t,且 \Omega_{t+1} = \Omega_t。如果在时间 Ta_T = \texttt{ANSWER},则 episode 终止,最终答案由 \hat{y} = \operatorname{Agg}(s_T) 产生。

我们的目标是找到一个由代码定义的策略 \pi,它将状态和超参数 \beta 映射到允许原子动作上的分布 \pi(\cdot \mid s, \beta) \in \Delta(\mathcal{A}(s))。这里,\beta 指定算法的可调超参数。我们还允许每个控制器包含其自己的终端聚合规则 \operatorname{Agg}_{\pi,\beta}。对于问题 q,令 \tau = (s_0, a_0, s_1, a_1, \dots, s_T) \sim P_{\pi,\beta}(\cdot \mid q) 表示从初始状态 s_0 = (q, 0, \emptyset, \emptyset, \emptyset) 运行 (\pi, \beta) 直到在时间 T 选择 \texttt{ANSWER} 所诱导的执行轨迹。轨迹分布 P_{\pi,\beta}(\cdot \mid q) 包括来自策略、生成过程和任何随机探针信号的随机性。在终端状态 s_T,最终答案和计算成本为 \hat{y}_{\pi,\beta}(\tau) = \operatorname{Agg}_{\pi,\beta}(s_T), C(\tau) = \operatorname{Cost}(s_T)。对于问题-答案对上的任务分布 \mathcal{D}

相似文章

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。

代理式测试时扩展(GitHub 仓库)

TLDR AI

AutoTTS 是一个开源工具,它利用代理发现机制,自动为大型语言模型(LLM)寻找最优的测试时扩展策略,通过基于重放的评估显著降低 token 消耗和成本。