@che_shr_cat: 1/ 参数规模是一种蛮力拐杖。如果一个35B模型仅通过扩展其搜索…就能击败1,000B模型呢?
摘要
探讨一个35B参数模型是否能够通过在测试时扩展其搜索视界来超越1000B模型,使用结构化过程反馈而非蛮力参数扩展。
查看缓存全文
缓存时间: 2026/07/20 09:29
1/ 参数规模是一种粗暴的拐杖。如果35B模型仅仅通过在测试时扩展搜索步数就能击败1000B模型,那会怎样?
这不是魔法,而是结构化过程反馈。让我们深入探究其原理。
2/ 在“扩展搜索步数而非参数规模”一文中,上海人工智能实验室推出了Agents-A1。
他们证明,在结构化执行轨迹上显式训练较小的模型,可以在复杂任务上媲美甚至超越万亿参数级的前沿模型。
3/ 该框架基于知识-动作图(KAG)运行。
轨迹不再被当作扁平文本,而是被形式化为可验证的四元组:(语料库, 动作, 观察结果, 验证器)。
每个动作只有在通过验证后才会被写回图中。
4/ 训练采用三阶段方案:
- 全领域监督微调(SFT)
- 专业化领域强化学习教师模型(使用GRPO)
- 多教师在线策略蒸馏
这解决了一个重大难题:当混合工具使用、搜索和指令遵循时产生的梯度冲突。
5/ 为了合并这些教师模型,他们使用了显著词汇对齐(SVA)。
学生模型不是蒸馏整个词汇表,而是仅针对按领域路由的教师模型,在其有效token的紧凑top-k切片上进行对齐。
这保证了训练稳定,防止了梯度冲突。
6/ 结果:Agents-A1(35B MoE)在SEAL-0上达到56.4分,超过了DeepSeek-V4(55.0)和Kimi-K2.6(50.5)。
在FrontierScience-Olympiad上,它获得79.0分,超过了DeepSeek-V4-Pro的76.0分。
我们看到一个35B模型展现出了前沿级别的能力。
7/ 问题在于:严重的延迟。
在测试时运行平均序列长度45K token,计算开销极大。
此外,它在MLE-bench上表现落后(43.9 vs GPT-5.5的72.7),证明对于复杂工程任务,长期目标一致性仍然极具挑战性。
8/ 要点:别再等待更大的模型了。
我们应该专注于结构化的过程级强化学习和测试时搜索。通过在线策略蒸馏统一专业化教师模型,是小规模本地部署的一条极具可行性的路径。
9/ 在此阅读我完整的技术解析:https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters…
在此查看原始论文:https://arxiv.org/abs/2606.30616
你是如何构建你的智能体轨迹数据的?欢迎在回复中讨论。
#机器学习
10/ 下方是多教师蒸馏过程的可视化分解。有时一张图表胜过万亿参数。
相似文章
扩展视野而非参数:以35B智能体达到万亿参数性能
介绍了Agents-A1,一个35B混合专家智能体模型,通过长视野轨迹缩放和三阶段训练方法(包括SFT、领域级教师和多教师蒸馏)实现了万亿参数级别的性能。在长视野智能体基准测试中,该模型表现优于或媲美更大规模的模型。
一个4b模型现在在网络研究上击败30b模型,原因不在于规模
来自Apodex家族的一个40亿参数开放模型在网页研究基准上优于300亿参数模型,这归因于精心构建的训练数据和自我验证技术,而非原始规模,表明AI能力发展趋向更民主化。
@che_shr_cat: 1/ 一个5M参数的模型刚刚在困难逻辑谜题上击败了前沿LLM,推理成本不到其十万分之一。…
一个5M参数的模型通过使用连续潜空间测试时计算,在困难逻辑谜题上以极低的推理成本超越了前沿LLM。
Agents-A1-4B (Qwen3.7-4B ???):扩展能力而非参数规模
Agents-A1-4B是InternScience推出的一款紧凑型4B参数模型,在多项智能体和推理基准测试中取得了最先进的结果,通过扩展能力而非参数规模超越了更大模型。
@j_golebiowski:17 亿参数模型在 Schema Guided Dialogue 上击败 7440 亿参数的 GLM-5——即便训练数据被污染。这相当于……
17 亿参数模型在训练数据受损的情况下,仍在 Schema Guided Dialogue 任务上超越 7440 亿参数的 GLM-5,体积效率高达 437 倍。