@che_shr_cat: 1/ 参数规模是一种蛮力拐杖。如果一个35B模型仅通过扩展其搜索…就能击败1,000B模型呢?

X AI KOLs Timeline 论文

摘要

探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。

1/ 参数规模是一种蛮力拐杖。如果一个35B模型仅通过在测试时扩展其搜索视界就能击败1,000B模型呢? 这不是魔法。这是结构化过程反馈。让我们来看看其内部机制。🧵 https://t.co/wsTyq46MQL
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:29

1/ 参数规模是一种粗暴的拐杖。如果35B模型仅仅通过在测试时扩展搜索步数就能击败1000B模型,那会怎样?

这不是魔法,而是结构化过程反馈。让我们深入探究其原理。

2/ 在“扩展搜索步数而非参数规模”一文中,上海人工智能实验室推出了Agents-A1。

他们证明,在结构化执行轨迹上显式训练较小的模型,可以在复杂任务上媲美甚至超越万亿参数级的前沿模型。

3/ 该框架基于知识-动作图(KAG)运行。

轨迹不再被当作扁平文本,而是被形式化为可验证的四元组:(语料库, 动作, 观察结果, 验证器)。

每个动作只有在通过验证后才会被写回图中。

4/ 训练采用三阶段方案:

  1. 全领域监督微调(SFT)
  2. 专业化领域强化学习教师模型(使用GRPO)
  3. 多教师在线策略蒸馏

这解决了一个重大难题:当混合工具使用、搜索和指令遵循时产生的梯度冲突。

5/ 为了合并这些教师模型,他们使用了显著词汇对齐(SVA)。

学生模型不是蒸馏整个词汇表,而是仅针对按领域路由的教师模型,在其有效token的紧凑top-k切片上进行对齐。

这保证了训练稳定,防止了梯度冲突。

6/ 结果:Agents-A1(35B MoE)在SEAL-0上达到56.4分,超过了DeepSeek-V4(55.0)和Kimi-K2.6(50.5)。

在FrontierScience-Olympiad上,它获得79.0分,超过了DeepSeek-V4-Pro的76.0分。

我们看到一个35B模型展现出了前沿级别的能力。

7/ 问题在于:严重的延迟。

在测试时运行平均序列长度45K token,计算开销极大。

此外,它在MLE-bench上表现落后(43.9 vs GPT-5.5的72.7),证明对于复杂工程任务,长期目标一致性仍然极具挑战性。

8/ 要点:别再等待更大的模型了。

我们应该专注于结构化的过程级强化学习和测试时搜索。通过在线策略蒸馏统一专业化教师模型,是小规模本地部署的一条极具可行性的路径。

9/ 在此阅读我完整的技术解析:https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters…

在此查看原始论文:https://arxiv.org/abs/2606.30616

你是如何构建你的智能体轨迹数据的?欢迎在回复中讨论。

#机器学习

10/ 下方是多教师蒸馏过程的可视化分解。有时一张图表胜过万亿参数。

相似文章

扩展视野而非参数:以35B智能体达到万亿参数性能

Hugging Face Daily Papers

介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。