@berryxia: 小块有大智慧?这下真成真了! 7B小模型现在直接当上了GPT-5、Claude Sonnet 4、Gemini 2.5 Pro这些顶级大模型的老板。 一篇最新论文里,一个用强化学习训练的7B模型学会了写自然语言子任务、分配给不同大模型、精…
摘要
一篇最新论文提出通过强化学习训练7B小模型作为任务调度器,自动分解子任务并分配给GPT-5、Claude等顶级大模型,在多项硬核基准上超越单一前沿模型,证明端到端奖励学习可有效替代人工Prompt工程与多智能体流水线设计。
小块有大智慧?这下真成真了! 7B小模型现在直接当上了GPT-5、Claude Sonnet 4、Gemini 2.5 Pro这些顶级大模型的老板。 一篇最新论文里,一个用强化学习训练的7B模型学会了写自然语言子任务、分配给不同大模型、精确指定上下文,最后在GPQA Diamond、LiveCodeBench、AIME25等硬核基准上全面超过单个前沿模型,而且平均每个问题只调用三次大模型,比手动设计的多代理系统还高效。 最狠的是:它证明了目前商业AI产品里那些靠人工手调的prompt engineering和pipeline设计,完全可以通过奖励信号端到端学会。 以前大家觉得智能拼的是模型大小,现在看来,真正拉开差距的是“谁更会指挥”。 这才是AI下一阶段最被低估的真相。
相似文章
@mylifcc: 这不是普通的大模型,而是一个多代理编排系统(Multi-Agent Orchestration System)——它自己就是一个小模型,却能智能地动态协调 GPT、Claude、Gemini 等多个前沿模型,自主分配角色、拆分任务,完成复…
Sakana AI 发布了一个多代理编排系统(Multi-Agent Orchestration System),它通过一个小模型智能协调 GPT、Claude 和 Gemini 等前沿大模型来自主分配任务和处理复杂工作。
@alex_verem: 一组研究人员刚刚证明,你不需要更大的模型,你需要更聪明的计划。来自清华大学和……
来自清华大学和华南理工大学的研究人员引入了原子任务图(ATG),这是一个框架,通过基于有向图的规划和内部模拟,大幅降低幻觉率,使7B-8B开源模型在不进行微调的情况下,在复杂智能体基准测试中超越GPT-4。
Meet GPT-5.6
OpenAI 发布 GPT-5.6 系列模型,每个 token 提供更多智能、更强方向一致性,并引入程序化工具调用、子代理委托和全新推理级别,显著提升自主开发效率。
@FinanceYF5: 大家都在吹百万token上下文,但Prime Intellect一位工程师说了句大实话: GPT-5.5在256k时检索准确率80%,拉到一百万直接掉到36%。模型不是装不下,是装进去了推理不动——所谓的context rot。 为什么更…
Prime Intellect工程师指出,大语言模型如GPT-5.5在百万token上下文时检索准确率从256k时的80%降至36%,表明存在“context rot”问题,即模型能容纳但无法有效推理长上下文,对Agent应用构成挑战。
@cuisitekp: 9B 的模型,把比它大好几倍的模型干下去了。 Ai2 和华盛顿大学那拨做 OLMo / Tülu 的人,放出一篇新论文叫 Tmax,自称是目前最强的开源「终端 agent」RL 训练配方。 成绩:一个 9B 模型在 Terminal-Be…
Ai2和华盛顿大学发布论文Tmax,提出目前最强的开源终端智能体RL训练配方。仅用9B参数模型在Terminal-Bench 2.0上击败更大模型,关键在于低成本生成大量可验证训练数据,而非模型规模或算法。