7.9B总参数中激活1.3B,面向智能体工作。这条曲线在哪里变平?

Reddit r/ArtificialInteligence 模型

摘要

InclusionAI(蚂蚁集团实验室)发布了Ling 3.0 Tiny,一个封闭API模型,总参数7.9B中激活1.3B,支持256K上下文、原生函数调用,并具备思考/即时模式,面向多轮智能体工具循环。文章质疑其效率曲线,并指出尚无独立评测或开放权重。

一个每token大约只激活1.3B参数(总参数7.9B)的模型,现在被定位为智能体骨干而非玩具。这让我不禁想问:效率曲线究竟在哪里变平?因为显然它还没有。规格表才是有趣的部分。256K上下文,最多输出32K token。原生函数调用和提示缓存,加上思考模式与即时模式之间的切换,让你可以在不需要推理延迟的轮次中跳过它。整个模型瞄准的是多轮工具循环,而非一次性聊天。这就是Ling 3.0 Tiny,来自InclusionAI,即蚂蚁集团的实验室。这些是实验室自己报告的数字,我还没有看到独立评估,请据此斟酌。说清楚是因为这个子版块大概会在四条评论之内问到:没有权重。没有GGUF,HuggingFace上什么都没有,你不能自托管。它是一个托管的API,按需租用,可通过Vercel的网关访问(太平洋时间8月14日上午8点前免费),此外还有OpenRouter和ZenMux。闪存大小的兄弟模型是另一个话题。这个是封闭的。我真正感兴趣的是token消耗的数学问题。如果激活参数继续这样下降,每个智能体的无聊中间层就会接近免费,选择模型不再是一个架构决策,而变成一种商品购买。这里有人在自己的工作负载上把它和小的开放模型做过正面比较吗?我想看看它在什么地方会输。
查看原文

相似文章