7.9B总参数中激活1.3B,面向智能体工作。这条曲线在哪里变平?
摘要
InclusionAI(蚂蚁集团实验室)发布了Ling 3.0 Tiny,一个封闭API模型,总参数7.9B中激活1.3B,支持256K上下文、原生函数调用,并具备思考/即时模式,面向多轮智能体工具循环。文章质疑其效率曲线,并指出尚无独立评测或开放权重。
一个每token大约只激活1.3B参数(总参数7.9B)的模型,现在被定位为智能体骨干而非玩具。这让我不禁想问:效率曲线究竟在哪里变平?因为显然它还没有。规格表才是有趣的部分。256K上下文,最多输出32K token。原生函数调用和提示缓存,加上思考模式与即时模式之间的切换,让你可以在不需要推理延迟的轮次中跳过它。整个模型瞄准的是多轮工具循环,而非一次性聊天。这就是Ling 3.0 Tiny,来自InclusionAI,即蚂蚁集团的实验室。这些是实验室自己报告的数字,我还没有看到独立评估,请据此斟酌。说清楚是因为这个子版块大概会在四条评论之内问到:没有权重。没有GGUF,HuggingFace上什么都没有,你不能自托管。它是一个托管的API,按需租用,可通过Vercel的网关访问(太平洋时间8月14日上午8点前免费),此外还有OpenRouter和ZenMux。闪存大小的兄弟模型是另一个话题。这个是封闭的。我真正感兴趣的是token消耗的数学问题。如果激活参数继续这样下降,每个智能体的无聊中间层就会接近免费,选择模型不再是一个架构决策,而变成一种商品购买。这里有人在自己的工作负载上把它和小的开放模型做过正面比较吗?我想看看它在什么地方会输。
相似文章
@Chinazhidx:蚂蚁集团刚刚发布了Ling-3.0-flash • 124B MoE • 5.1B 活跃参数/令牌 • 256K 上下文,可扩展至1M,仅八分之一……
蚂蚁集团发布了Ling-3.0-flash,这是一个124B MoE模型,每个令牌5.1B活跃参数,256K上下文可扩展至1M,在大多数基准测试中匹配或超越其1T旗舰模型。
@AntLingAGI:发布 Ling-2.6-flash,104B 总参、7.4B 激活的稀疏指令模型
Ling-2.6-flash 是 104B 总参/7.4B 激活的稀疏指令模型,专为 token 效率优化,可在智能体任务中降低成本、提升吞吐。
@0x0SojalSec: 最终观点:腾讯最近发布了一个295B参数的模型,每个token仅激活21B参数。而大多数实验室仍在……
腾讯发布了Hy3,一个295B参数的MoE模型,每个token激活21B参数,在代理编程和工具使用任务上与更大的模型相竞争,并提供了Apache 2.0权重。
也许下一个模型的胜利在于降低智能体工作流的消耗
文章讨论了下一个重要的模型进步可能在于降低智能体工作流的成本,重点介绍了蚂蚁集团的 Ling-2.6-1T,这是一个万亿参数模型,旨在以低计算开销实现高效推理和任务执行。
新模型发布:Ling-3.0-tiny:总参数7.9B,每个token仅激活1.3B——免费一周
Ling-3.0-tiny发布:一款混合推理模型,总参数7.9B,每个token仅激活1.3B,免费一周。