也许下一个模型的胜利在于降低智能体工作流的消耗
摘要
文章讨论了下一个重要的模型进步可能在于降低智能体工作流的成本,重点介绍了蚂蚁集团的 Ling-2.6-1T,这是一个万亿参数模型,旨在以低计算开销实现高效推理和任务执行。
关于模型的讨论仍然围绕着同一个问题:在顶尖水平上谁最聪明?但对于智能体系统来说,实际的问题可能更简单:哪个模型能让长工作流在经济上保持合理?Ling-2.6-1T 之所以有趣,是因为其公开定位直接点明了这一点。蚂蚁的文档将其描述为一个万亿参数的旗舰模型,旨在从逻辑推理到任务执行都保持最低的计算开销,并且模型卡片不断强调快速思考和更低的 Token 开销。这正好对应了真实智能体栈中容易出问题的地方。长链变得昂贵,重试堆积,每一步冗长的输出都让系统更难被证明合理。我宁愿少一些排行榜热度,来换取一个能让长智能体工作流运行更便宜、扩展更容易的模型。我愿意做这个交易。你呢?
相似文章
AI agents 正在改变人们对计算成本的看法
本文讨论了AI代理工作流如何将优化重心从单纯的推理成本转向更广泛的挑战,如延迟、编排开销和可靠性。文章强调了向混合架构和动态模型路由发展的趋势,以应对这些多步骤工作流的复杂性。
下一代模型需要什么?
关于前沿人工智能使用方式下一次演进的讨论,质疑基于云的智能体工作流和大规模分布式计算是否会取代本地部署,并引用了Tibo的推文和OpenAI最近的数学成果。
7.9B总参数中激活1.3B,面向智能体工作。这条曲线在哪里变平?
InclusionAI(蚂蚁集团实验室)发布了Ling 3.0 Tiny,一个封闭API模型,总参数7.9B中激活1.3B,支持256K上下文、原生函数调用,并具备思考/即时模式,面向多轮智能体工具循环。文章质疑其效率曲线,并指出尚无独立评测或开放权重。
@dair_ai: 新论文值得一读。完整的代理工作流可以蒸馏到模型权重中,以约 100 倍更低的推理成本运行…
本文展示了代理工作流可以蒸馏到小型微调模型中,在实现接近前沿质量的同时,与编排方法相比将推理成本降低两个数量级。
@omarsar0: 结果很有趣。这就是为什么我预计更多智能体工作负载将运行在混合模型上。来自@TheUnbiasedCo的Pareto 26.9...
文章讨论了一项性能评估,其中混合AI模型Pareto 26.9在智能体任务中与GPT-6 Astra并列第一,每个成功任务的成本约为其他模型的三分之一,并且完成速度快于其他模型,这表明混合模型在智能体工作负载方面具有潜力。